Logo gridscale GmbH

Site Reliability Engineer - Openstack

Neu

Job

  • Level
    Senior
  • Ort
    Köln
  • Arbeitsmodell
    Hybrid, Onsite
  • Job Feld
    IT, DevOps, Back End
  • Anstellung
    Vollzeit
  • Vertragsart
    Unbefristetes Dienstverhältnis

Job Zusammenfassung

In dieser Rolle entwickelst du komplexe OpenStack-basierte Cloud-Infrastrukturen und betreibst automatisierte Prozesse mit Ansible, Terraform und Kubernetes, während du Incident Response und AI-Assisted Engineering integrierst.

Job Technologien

Deine Rolle im Team

  • Du unterstützt uns dabei, die On-Premise-Cloud-Plattform von OVHcloud weiterzuentwickeln, zu betreiben und zu industrialisieren.
  • Als Teil eines kleinen, erfahrenen Teams arbeitest du an unserer OpenStack-basierten Infrastruktur sowie am Kubernetes- und GitOps-Stack, auf dem unsere kundenorientierte Cloud-Plattform läuft.
  • AI-Assisted Engineering ist dabei ein fester Bestandteil unserer täglichen Engineering-Praxis - von Spec-Driven Development über agentische Coding-Workflows bis hin zu Incident Response und Automatisierung.
  • Die Plattform befindet sich aktiv im Aufbau, sodass du direkten Einfluss auf Architektur, Automatisierungsstrategie und den Einsatz von AI im Platform Engineering hast.
  • Als Senior übernimmst du Ownership für deine Themen und gestaltest deinen fachlichen Schwerpunkt entlang deiner Stärken - mit Fokus auf Automation, Compute Lifecycle, Platform Engineering und AI Substrate.
  • Du konzipierst und entwickelst unsere OpenStack-basierte On-Premise-Cloud-Infrastruktur mit dem Ziel, komplette Cloud-Umgebungen hochautomatisiert auf Bare Metal ausrollen und in Betrieb nehmen zu können.
  • Du entwickelst und betreibst Infrastructure as Code mit Ansible und Terraform sowie unsere Kubernetes- und GitOps-Workflows mit FluxCD / ArgoCD - unterstützt durch LLMs, agentische Workflows und automatisierte Test- und Review-Prozesse.
  • Du verantwortest den Lifecycle unserer Compute-Infrastruktur - von Bare Metal, Firmware und Provisionierung bis zu Hypervisoren und virtuellen Compute Nodes.
  • Dazu gehören unter anderem Patching, Migrationen, Host Evacuations, Capacity Rebalancing und die Automatisierung eines stabilen Plattformbetriebs.
  • Du entwickelst unser AI Substrate und unsere Self-Healing-Strategie weiter - von strukturierten Knowledge Bases und agentischen Workflows für Incident Triage und Capacity Planning bis hin zur schrittweisen Automatisierung heutiger Runbooks.
  • Du konzipierst Tests für Non-Regression, Performance und Security, dokumentierst und paketierst Lösungen und verbesserst die Plattform kontinuierlich anhand von Telemetrie, Betriebserfahrungen und Nutzerfeedback.
  • Als Senior Engineer bist du technische Ansprechperson und Sparringspartner für Kolleg rund um Automation, Platform Engineering und AI Tooling.

Unsere Erwartungen an dich

Qualifikationen

  • Du hast Compute-Infrastruktur bereits End-to-End betrieben - von Firmware-/BIOS-Rollouts, Bare-Metal-Provisionierung und Hardware-Diagnostik bis zu Hypervisoren, Migrationen, Host Evacuations, Graceful Drains und Capacity Rebalancing.
  • AI-Assisted Engineering gehört für dich bereits zum Arbeitsalltag.
  • Du arbeitest eigenverantwortlich, bringst ein ausgeprägtes Ownership-Mindset mit und hast Freude daran, Dinge nicht nur zu betreiben, sondern kontinuierlich besser zu machen.
  • Gleichzeitig teilst du dein Wissen gerne und kannst komplexe technische Zusammenhänge klar vermitteln.
  • Wir arbeiten in einem internationalen Umfeld auf Englisch.
  • Du fühlst dich deshalb sicher dabei, technische Themen auf Englisch zu diskutieren, zu dokumentieren und gemeinsam im Team voranzutreiben.

Erfahrung

  • Du bringst mehrere Jahre praktische Erfahrung als SRE, Platform Engineer oder DevOps Engineer im Betrieb produktiver Infrastruktur mit und verfügst über fundierte Erfahrung mit OpenStack, Kubernetes und Linux, auch auf Bare Metal.
  • Du arbeitest sicher mit Ansible, Terraform sowie GitOps-Workflows wie FluxCD oder ArgoCD und hast Erfahrung damit, automatisierte Prozesse stabil und reproduzierbar in Produktionsumgebungen zu betreiben.
  • Du bringst Erfahrung mit Go und/oder Python sowie mit Claude Code, Cursor, Aider oder vergleichbaren agentischen Coding-Umgebungen mit.
  • Auch Observability, Networking, Compute-Tuning, Auto-Remediation, Security-kritische Infrastrukturen und Multi-Site-Cloud-Umgebungen gehören zu deinem technischen Erfahrungsspektrum.

Unser Angebot

  • Eine Plattform im echten Build Mode mit viel Gestaltungsspielraum, sichtbarem Einfluss auf Architekturentscheidungen und einem erfahrenen Senior-Team, in dem Autonomie und Ownership zählen.
  • AI-Augmented Engineering als fester Bestandteil unserer Arbeitsweise.
  • Außergewöhnlicher Teamspirit über alle Abteilungen und Ländergrenzen hinweg - wir leben #OneTeam.
  • Spannende Aufgaben in einem hochinnovativen und internationalen Umfeld mit modernsten Technologien.
  • 32 Urlaubstage.
  • Flexible Arbeitszeiten, Homeoffice-Möglichkeiten und eine sichere, unbefristete Anstellung mit markt- und leistungsorientierter Vergütung.
  • Arbeitgeberfinanzierte Altersvorsorge und ein attraktives Versicherungspaket.
  • OVHcloud übernimmt 50 % der Kosten für den öffentlichen Nahverkehr.
  • Bis zu 400 € jährlicher Zuschuss für Sportaktivitäten, zum Beispiel Fitnessstudio oder Sportkurse.
  • Attraktive Rabatte bei zahlreichen Shops und Unternehmen über Corporate Benefits.
  • Wir beteiligen uns am Leasing deines Cargo Bikes.
  • Regelmäßige Company Events sowie kostenlose Kalt- und Heißgetränke.

Benefits

Work-Life-Integration

Themen mit denen du dich im Job beschäftigst

Job Standorte

  • Standort Köln

    Nordrhein-Westfalen

    Deutschland

Das ist dein Arbeitgeber

gridscale GmbH

gridscale GmbH

gridscale ist ein europäischer IaaS- und PaaS-Anbieter und schafft mit seiner innovativen Technologie die Basis für anspruchsvolle Cloud-Lösungen. Das Unternehmen mit Hauptsitz in Köln bietet zukunftsorientierten und digital ausgerichteten Nutzern mit seiner hochautomatisierten Architektur eine Lösung, in der sie flexibel zwischen einer Vielzahl an Infrastructure-as-a-Service-Komponenten sowie komplementären Platform-as-Service-Elementen wählen können.

Description

  • Gründungsjahr
    2014
  • Unternehmenstyp
    Etablierte Firma
  • Arbeitsmodell
    Hybrid, Onsite
  • Branche
    Internet, IT, Telekom
Logo gridscale GmbH

Site Reliability Engineer - Openstack

Ort
Köln
Arbeitsmodell
Hybrid, Onsite
Diversität
Für alle Personen geeignet (m/w/d)

Weitere Jobs