Logo Deutsche Telekom AG

Site Reliability Engineer

Neu

Job

  • Level
    Erfahren
  • Ort
    Magdeburg, Kassel, Berlin, Karlsruhe, München, Dresden, Bielefeld, Darmstadt, Saarbrücken, Hannover
  • Arbeitsmodell
    Hybrid, Onsite
  • Job Feld
    IT, DevOps, Security
  • Anstellung
    Vollzeit
  • Vertragsart
    Unbefristetes Dienstverhältnis

Job Zusammenfassung

In dieser Rolle entwickelst du Observability-Lösungen für Cloud- und Kubernetes-Plattformen, integrierst OpenTelemetry und Jaeger, sowie automatisierst Prozesse in Go oder Python zur Überwachung komplexer Infrastrukturen.

Job Technologien

Deine Rolle im Team

  • Als Site Reliability Engineer mit Schwerpunkt Observability tragen Sie maßgeblich dazu bei, Transparenz, Stabilität und Zuverlässigkeit unserer verteilten Cloud-, Edge- und Kubernetes-Plattformen sicherzustellen.
  • Sie übernehmen eine zentrale Rolle bei der Konzeption, Implementierung und kontinuierlichen Weiterentwicklung moderner Observability-Lösungen und schaffen die Grundlage für einen zuverlässigen Betrieb komplexer, cloud-nativer Infrastrukturen.
  • Mit Ihrer Expertise in OpenTelemetry, Distributed Tracing und modernen Telemetrie-Architekturen entwickeln und betreiben Sie leistungsfähige Pipelines für Metrics, Logs und Traces.
  • Dabei integrieren Sie den OpenTelemetry Collector, OTLP sowie SDKs und Auto-Instrumentation in bestehende Plattformen und schaffen eine durchgängige End-to-End-Observability über verteilte Anwendungen und Services hinweg.
  • Sie implementieren und betreiben Jaeger als zentrale Plattform für Distributed Tracing und entwickeln Korrelationsmechanismen zwischen Logs, Metrics und Traces, um Fehlerursachen schnell zu identifizieren und komplexe Abhängigkeiten innerhalb verteilter Systeme transparent darzustellen.
  • Darüber hinaus integrieren Sie Security-, Infrastruktur- und Plattform-Events in zentrale SIEM-Lösungen und entwickeln standardisierte Telemetrie- und Instrumentierungskonzepte für Kubernetes- und Cloud-Native-Plattformen.
  • Mit Ihren Programmierkenntnissen in Go, Python oder Shell automatisieren Sie Integrations- und Betriebsprozesse und leisten einen wesentlichen Beitrag zur Weiterentwicklung einer skalierbaren, hochverfügbaren und zukunftssicheren Observability-Plattform für moderne verteilte Infrastrukturen.

Unsere Erwartungen an dich

Qualifikationen

  • Sehr gute Kenntnisse in OpenTelemetry, insbesondere im Umgang mit dem OpenTelemetry Collector, OTLP, SDKs sowie Auto-Instrumentation.
  • Fundierte Kenntnisse in der Integration von SIEM-Lösungen, im Security Event Management sowie im Einsatz von CEF- und Syslog-basierten Protokollen.
  • Gute Programmierkenntnisse in Go, Python oder Shell zur Umsetzung von Telemetrie-, Integrations- und Automatisierungsaufgaben.
  • Ausgeprägtes Verständnis für IT-Sicherheit und Security Awareness.
  • Analytische und strukturierte Arbeitsweise.
  • Sehr gutes Deutsch in Wort und Schrift (C1-Niveau).

Erfahrung

  • Fundierte Erfahrung mit Distributed Tracing, einschließlich Span Correlation, Context Propagation und Sampling-Strategien.
  • Erfahrung im Aufbau und Betrieb von Jaeger, insbesondere hinsichtlich Trace Storage, Indexierung und Query-Optimierung.
  • Erfahrung im Bereich Kubernetes Observability, Cloud-Native-Plattformen sowie moderner Telemetrie-Architekturen.
  • Erfahrung im Site Reliability Engineering oder Infrastruktur-Betrieb.

Unser Angebot

  • Sie erwartet eine anspruchsvolle Aufgabe im Umfeld moderner Cloud-Native-, Kubernetes-, Edge- und Observability-Technologien.
  • In dieser Position gestalten Sie den Aufbau einer zukunftsfähigen Observability-Plattform aktiv mit und arbeiten an innovativen Lösungen für Telemetrie, Distributed Tracing und Security Monitoring in verteilten Infrastrukturen.
  • Dabei kommen aktuelle Open-Source-Technologien wie OpenTelemetry, Jaeger und moderne Cloud-Native-Werkzeuge zum Einsatz, um Transparenz und Zuverlässigkeit komplexer Plattformen kontinuierlich zu verbessern.
  • Sie arbeiten in einem technologisch anspruchsvollen Umfeld mit einem hohen Maß an Gestaltungsspielraum und leisten einen wesentlichen Beitrag zur Stabilität, Sicherheit und Skalierbarkeit geschäftskritischer Systeme.

Benefits

Work-Life-Integration

Gesundheit, Fitness & Fun

Mehr Netto

Themen mit denen du dich im Job beschäftigst

Job Standorte

  • Standort München

    Bayern

    Deutschland

  • Standort Karlsruhe

    Baden-Württemberg

    Deutschland

  • Standort Saarbrücken

    Saarland

    Deutschland

  • Standort Darmstadt

    Hessen

    Deutschland

  • Standort Dresden

    Sachsen

    Deutschland

  • Standort Kassel

    Hessen

    Deutschland

  • Standort Bielefeld

    Nordrhein-Westfalen

    Deutschland

  • Standort Magdeburg

    Sachsen-Anhalt

    Deutschland

  • Standort Hannover

    Niedersachsen

    Deutschland

  • Standort Berlin

    Deutschland

Das ist dein Arbeitgeber

Deutsche Telekom AG

Deutsche Telekom AG

Wir bereiten uns auf die Gigabit-Gesellschaft vor: Als führendes Unternehmen der Kommunikations- und Informationstechnologie gestalten wir mit innovativen Lösungen für Privat- und Geschäftskunden die digitale Welt von morgen.

Description

  • Unternehmenstyp
    Etablierte Firma
  • Arbeitsmodell
    Full Remote, Hybrid, Onsite
  • Branche
    Internet, IT, Telekom

Arbeitgeber-Reviews

von devworkplaces.com

Gesamt

(1 Bewertung)
3.5
  • Career Growth

    3.7
  • Culture

    3.5
  • Engineering

    2.8
  • Workingconditions

    4.0
Alle Reviews anzeigen
Logo Deutsche Telekom AG

Site Reliability Engineer

Ort
Magdeburg, Kassel, Berlin, Karlsruhe, München, Dresden, Bielefeld, Darmstadt, Saarbrücken, Hannover
Arbeitsmodell
Hybrid, Onsite
Diversität
Für alle Personen geeignet (m/w/d)

Weitere Jobs