Logo RWTH Aachen

DevOps / MLOps Engineer

Job

  • Level
    Erfahren
  • Job Feld
    IT, Data, DevOps
  • Anstellung
    Vollzeit
  • Vertragsart
    Befristetes Dienstverhältnis
  • Ort
    Aachen
  • Arbeitsmodell
    Onsite
  • Job Zusammenfassung

    In dieser Rolle entwickelst du einheitliche KI-Gateways und optimierst Inferenz-Plattformen auf HPC-Systemen, während du standardisierte APIs implementierst und das Monitoring für KI-Modelle sicherstellst.

    Job Technologien

    Deine Rolle im Team

    • Die HPC-Gruppe PRAM des IT Centers entwickelt in enger Zusammenarbeit mit dem Lehrstuhl für Informatik 12 kontinuierlich ihre Methodenkompetenz im Bereich Hochleistungsrechnen und Künstlicher Intelligenz auf HPC-Systemen weiter.
    • Die Hauptaufgaben dieser Arbeitsgruppe umfassen sowohl die Forschung als auch die methodische Unterstützung der Nutzerinnen und Nutzer bei Fragen zur Programmentwicklung, Fehlersuche, Performance-Tuning und Parallelisierung.
    • Zudem stellt die Gruppe die erforderlichen Werkzeuge und Hilfsmittel für diese Aufgaben bereit.
    • Konzeption und Realisierung eines einheitlichen KI-Gateways.
    • Weiterentwicklung eines standortübergreifenden Inferenz-Gateways, das Ressourcen aus unterschiedlichen Systemen (HPC-Cluster, Kubernetes-Umgebungen) zusammenführt.
    • Definition, Implementierung und Pflege standardisierter APIs/Schnittstellen für den einheitlichen Zugriff auf die Inferenz-Backends.
    • Konfiguration, Deployment und Optimierung der Ausführung von Open-Source bzw. Open-Weight-LLMs auf Hochleistungsrechnern (HPC) sowie in Kubernetes-Clusters.
    • Anpassung der Betriebsbedingungen (Ressourcenzuweisung, Skalierung, Container-Images) an die jeweiligen Hosting-Szenarien.
    • Sicherstellung einer skalierbaren Lastverteilung, hohen Resilienz und Redundanz sowohl auf Ebene des Gateways als auch der lokalen Inferenz-Cluster.
    • Weiterentwicklung und Konfiguration des Monitorings für die Inferenz-Infrastruktur und einzelne Modell-Instanzen (Metriken, Alerting, Dashboarding).
    • Konzeption und Durchführung automatisierter Regression-Tests für KI-Modelle (Performance, Funktionalität, verschiedene Modalitäten).
    • Planung und Begleitung von Last- und Penetrationstests der gesamten Inferenz-Infrastruktur zur Gewährleistung von Sicherheit und Robustheit.
    • Unterstützung bei Konzeption und Umsetzung von agenten-basierten Prozessen (z. B. Retrieval-Augmented-Generation), die die bereitgestellten KI-Modelle nutzen.
    • Einbindung der Inferenz-Ressourcen in RAG-Setups sowie Anbindung an Model-Context-Protocol (MCP) Services zur nahtlosen Orchestrierung.

    Unsere Erwartungen an dich

    Ausbildung

    • Ein erfolgreich abgeschlossenes Hochschulstudium (Master oder vergleichbar) in der Informatik, den Natur- oder Ingenieurwissenschaften oder eine vergleichbare Qualifikation.

    Qualifikationen

    • Sie verfügen über sichere Kenntnisse in Skriptsprachen (z. B. Bash, Python) und objekt-orientierten Programmiersprachen, vorzugsweise in C#/.NET.
    • Gute Kenntnisse in Deutsch und Englisch (mündlich sowie schriftlich).
    • Sicherer Umgang mit Hochleistungs-Clustern und gängigen Schedulern (z. B. SLURM, PBS, LSF) zur Submittierung und Verwaltung von Rechen-Jobs.
    • Kenntnisse im automatisierten Testen von KI-Modellen, inklusive Regressionstests sowie Last- und Penetrationstests.
    • Vertrautheit mit Observability-Tools wie Prometheus, Grafana, Loki oder ähnlichen Stacks.
    • Begeisterung für Parallelisierung, High-Performance-Computing und aktuelle Anwendungsfelder im Bereich Künstliche Intelligenz und Machine Learning.
    • Persönlich überzeugen Sie durch Ihre hohe Motivation, Ihr Engagement sowie Ihre ausgeprägte soziale Kompetenz.
    • Sie arbeiten gerne im Team, übernehmen Verantwortung und bringen sich aktiv mit Ihren Ideen ein.

    Erfahrung

    • Sie besitzen fundierte Erfahrung im Umgang mit Linux-Systemen, inklusive Shell-Scripting sowie Paket- und Service-Management.
    • Sie haben praktische Erfahrung mit Container-Technologien und deren Orchestrierung, zum Beispiel Docker, Docker Compose und Kubernetes.
    • Praktische Erfahrung mit der Ausführung von KI-Modellen mit Hilfe von Inferenz-Plattformen oder Frameworks (z. B. Deployment von LLMs, Model-Serving).
    • Erfahrung in der Gestaltung von Micro-Service-Architekturen und der Implementierung von REST- bzw. gRPC-Schnittstellen.
    • Praktische Erfahrung mit Retrieval-Augmented-Generation (RAG) und agentischen KI-Workflows.

    Unser Angebot

    • Die Einstellung erfolgt im Beschäftigtenverhältnis.
    • Die Stelle ist zum nächstmöglichen Zeitpunkt zu besetzen und befristet bis zum 31.12.2030.
    • Die Befristung richtet sich nach § 14 Abs. 1 Teilzeit- und Befristungsgesetz (TzBfG).
    • Es handelt sich um eine Vollzeitstelle.
    • Die Eingruppierung richtet sich nach dem TV-L.
    • Die Stelle ist bewertet mit EG 13.

    Benefits

    Work-Life-Integration

    Gesundheit, Fitness & Fun

    Themen mit denen du dich im Job beschäftigst

    Job Standorte

    • Standort Aachen

      Nordrhein-Westfalen

      Deutschland

    Das ist dein Arbeitgeber

    RWTH Aachen

    RWTH Aachen

    Das Institut für Technologie- und Innovationsmanagement (TIM) unter der Leitung von Professor Dr. David Antons, Prof. Dr. Frank Piller und Prof. Dr. Oliver Salge ist eine führende Institution in den Forschungsfeldern Innovations- und Technologiemanagement sowie Strategieentwicklung im Management des technologischen Wandels. Derzeit lehrt und forscht am TIM-Institut ein interdisziplinäres Team aus Betriebswirtschaft, Psychologie, Informatik sowie dem Ingenieurwesen in enger Kooperation mit den ingenieurswissenschaftlichen Instituten der RWTH Aachen.

    Description

  • Unternehmenstyp
    Etablierte Firma
  • Arbeitsmodell
    Hybrid, Onsite
  • Branche
    Wissenschaft, Forschung
  • Logo RWTH Aachen

    DevOps / MLOps Engineer

    Ort
    Aachen
    Arbeitsmodell
    Onsite
    Diversität
    Für alle Personen geeignet (m/w/d)

    Weitere Jobs