Lebenslauf für MLOps Engineers: Beispiele und Anleitung
Ein Lebenslauf als MLOps Engineer kommt in die engere Wahl, wenn er belegt, dass Sie Modelle in Produktion gebracht und dort gehalten haben: wie viele Modelle, auf welchem Serving-Stack, mit welcher Latenz und zu welchen Kosten, mit welchem Retraining und Monitoring. Personalverantwortliche achten auf Plattformarbeit, nicht auf Genauigkeitswerte aus einem Notebook.
Lebenslauf-Muster für MLOps Engineers (7 Jahre, Plattformteam)
Dieses Muster zeigt einen Engineer, der aus Backend- und DevOps-Arbeit in ein Plattformteam für Machine Learning gewechselt ist. Namen und Unternehmen sind erfunden. Wenn Sie aus der Data Science kommen, behalten Sie den Aufbau und tauschen Sie die frühen Stellen aus; weiter unten gibt es einen Abschnitt zu diesem Weg.
Jonas Weber
MLOps Engineer
Berlin (remote) · 030 555 0192 · jonas.weber@beispiel.de · github.com/jweber-beispiel · linkedin.com/in/jonas-weber-beispiel
Profil
MLOps Engineer mit 7 Jahren in Backend, DevOps und ML-Plattformarbeit, seit über drei Jahren verantwortlich für eine Machine-Learning-Plattform auf AWS und Kubernetes. Verantwortet den Weg von der Trainingspipeline bis zum bereitgestellten Endpoint für über 40 Produktivmodelle in Betrugserkennung, Pricing und Empfehlungen. p99-Inferenzlatenz von 310 ms auf 95 ms und monatliche GPU-Kosten um 38 % gesenkt. Werkzeuge im Alltag: Kubernetes, Terraform, Airflow, MLflow, Ray, Triton, Prometheus und Grafana.
Berufserfahrung
MLOps Engineer · B2B-Fintech, 400 Beschäftigte, 30 Data Scientists und ML Engineers
02/2023 – heute
- Betrieb der internen ML-Plattform mit über 40 Modellen auf Kubernetes (EKS); Modellartefakte, Lineage und Stage-Promotion in MLflow, Infrastruktur in Terraform definiert.
- Neuaufbau des Echtzeit-Servings auf Triton Inference Server mit Dynamic Batching und ONNX-Konvertierung; p99-Latenz von 310 ms auf 95 ms gesenkt und die GPU-Node-Gruppe um 38 % verkleinert (rund 18.000 € im Monat).
- Standardisierung von 18 Trainingspipelines auf Airflow mit gemeinsamem Docker-Basisimage und DAG-Vorlage; die mittlere Zeit von einer gemergten Modelländerung bis zum Live-Endpoint sank von 9 Tagen auf 6 Stunden.
- Drift- und Qualitätsmonitoring mit Evidently und Prometheus für 22 geschäftskritische Modelle eingeführt, mit Alerts bei Feature-Drift und Verschiebung der Vorhersageverteilung; im ersten Quartal wurden drei unbemerkte Datenfehler entdeckt.
- Einführung des Feature Store Feast für 6 Teams, einschließlich Konsistenztests zwischen Offline und Online, die eine Abweichung zwischen Training und Serving bei 2 Betrugsmodellen stoppten.
- Rufbereitschaft für die Plattform jede fünfte Woche: 14 Runbooks geschrieben und die mittlere Wiederherstellungszeit bei Serving-Vorfällen von 52 auf 19 Minuten gesenkt.
DevOps Engineer · SaaS-Anbieter für Gesundheitsdaten, 120 Beschäftigte
08/2020 – 01/2023
- Migration von 60 Microservices von EC2 auf EKS mit Terraform und Helm; Deployment-Zeit von 25 auf unter 4 Minuten und Infrastrukturkosten um 22 % gesenkt.
- Aufbau der CI-Pipeline in GitHub Actions für 9 Teams: Unit-Tests, Container-Scans mit Trivy und signierte Images in ECR.
- Einrichtung von Prometheus, Grafana und Loki über 3 Cluster mit über 40 Alert-Regeln, abgeleitet aus Service Level Objectives.
- Die ersten zwei Data-Science-Modelle hinter einem FastAPI-Service in Produktion gebracht; das gab der Stelle die Richtung zur ML-Plattformarbeit.
Backend Engineer · Logistik-Start-up, 45 Beschäftigte
06/2019 – 07/2020
- Entwicklung von Python- und Go-Services für die Tourenzuweisung mit bis zu 1.200 Anfragen pro Sekunde in Spitzenzeiten.
- Aufbau des Batch-ETL für das erste Modell zur Nachfrageprognose, das täglich 30 GB von Postgres nach S3 und Redshift übertrug.
Ausbildung
Bachelor of Science Informatik
Hochschule, Berlin, 2019
Zertifikate
- Certified Kubernetes Administrator (CKA), Linux Foundation, 2023, erneuert 2025
- AWS Certified Machine Learning Engineer – Associate, 2025
- HashiCorp Certified: Terraform Associate, 2021, erneuert 2025
Kenntnisse
Worauf eine Leitung ML-Plattform beim Lesen achtet
MLOps-Stellen werden von sehr unterschiedlichen Unternehmen ausgeschrieben. Ein Start-up sucht jemanden, der den ganzen Weg allein verdrahten kann; ein Konzern will tiefes Kubernetes-Wissen oder eine bestimmte Cloud. Alle prüfen dieselben vier Dinge.
- Haben Sie Modelle ausgeliefert oder nur trainiert? Die stärkste einzelne Zeile in diesem Lebenslauf ist die Zahl der Modelle in Produktion und wer von ihnen abhängt. Wenn Sie nur ein Modell ausgeliefert, es aber von Anfang bis Ende verantwortet haben, schreiben Sie das; es schlägt vages Gerede über Plattformen.
- Serving und Skalierung. Batch, Echtzeit oder Streaming. Anfragen pro Sekunde, p50- und p99-Latenz, GPU oder CPU und das Serving-Framework. Arbeit mit großen Sprachmodellen bringt eigene Begriffe mit: vLLM, Token-Durchsatz, KV-Cache, Quantisierung, RAG-Pipelines.
- Tiefe in der Infrastruktur. Kubernetes, Terraform, eine Cloud in der Tiefe, CI/CD, Grundlagen in Netzwerk und IAM. MLOps-Stellen sind weiterhin Infrastrukturstellen, und ein Lebenslauf ohne Infrastrukturdetails liest sich wie der eines Notebook-Nutzers.
- Zuverlässigkeit und Kosten. Monitoring, Drift-Erkennung, Rollback, Rufbereitschaft, Vorfälle. Dann das Geld: eingesparte GPU-Kosten, richtig dimensionierte Instanzen, Nutzung von Spot-Instanzen. Kostenarbeit fällt derzeit besonders auf, weil die Rechnungen für Model Serving hoch und sichtbar sind.
“Die Lebensläufe, die zum Gespräch führen, sagen, was kaputtging und was die Person dagegen getan hat. Kubernetes und MLflow kann jeder auflisten. Nur sehr wenige können mir von der Abweichung zwischen Training und Serving erzählen, die sie gefunden haben, wie sie sie gefunden haben und wie das Monitoring heute aussieht.”
Profiltexte für den Lebenslauf als MLOps Engineer
Drei Zeilen. Jahre und Schwerpunkt, was Sie verantworten, der Stack, eine Zahl. Diese Beispiele decken die Wege ab, auf denen Menschen tatsächlich in diesen Beruf kommen.
MLOps Engineer mit 7 Jahren in der Infrastruktur, davon über drei im Betrieb einer ML-Plattform auf AWS und Kubernetes für 30 Data Scientists. Verantwortet Trainingspipelines, Model Registry, Serving und Monitoring für über 40 Produktivmodelle. p99-Latenz von 310 ms auf 95 ms und GPU-Kosten um 38 % gesenkt. Terraform, Airflow, MLflow, Triton, Prometheus.
Infrastructure Engineer mit 7 Jahren in Kubernetes, Terraform und GitOps, die letzten zwei mit dem Aufbau von CI/CD und Serving für Machine-Learning-Teams. Das Modell-Deployment von einer manuellen Übergabe auf eine Pipeline-Vorlage umgestellt, die 5 Teams nutzen. CKA-zertifiziert, erfahren in der Rufbereitschaft.
Machine Learning Engineer mit 6 Jahren, heute mit Schwerpunkt Produktivsysteme: 12 Modelle containerisiert, das Training von Laptops auf Ray auf Kubernetes verlagert und das Drift-Monitoring aufgebaut, das defekte Features meldet, bevor es das Geschäft merkt. Python, PyTorch, Airflow, MLflow, AWS SageMaker.
ML Platform Engineer mit 4 Jahren, betreibt derzeit selbst gehostete LLM-Inferenz mit vLLM auf 16 A100-GPUs für interne Retrieval-Anwendungen. Tokens pro Sekunde je GPU durch Continuous Batching und Quantisierung um das 2,3-Fache gesteigert und das Evaluations-Harness gebaut, das jedes Modell-Upgrade freigibt.
Softwareentwickler mit 2 Jahren im Python-Backend und einem Homelab mit drei Kubernetes-Nodes, auf denen drei eigene Modelle hinter einem FastAPI-Service laufen, mit MLflow-Tracking und Grafana-Dashboards. CKA-zertifiziert. Sucht eine erste Vollzeitstelle im MLOps-Bereich in einem Plattformteam.
Mit einem Beispiel starten, in wenigen Minuten fertig.
Zum Start ist keine Anmeldung nötig. Wählen Sie ein Beispiel, passen Sie es mit Vorschlägen an und behalten Sie die Vorschau beim Schreiben im Blick.
MLOps-Stichpunkte neu geschrieben: von schwach zu stark
MLOps-Stichpunkte scheitern auf eine bestimmte Art: Sie nennen Werkzeuge und hören dann auf. Ergänzen Sie Größenordnung und Ergebnis.
| Schwach | Stark |
|---|---|
| MLflow für Experiment-Tracking genutzt. | MLflow als einzige Model Registry für 6 Teams eingeführt, mit Freigabestufen für die Stage-Promotion, die im ersten Quartal 4 nicht validierte Modelle vor der Produktion stoppten. |
| Modelle in Produktion gebracht. | Über 40 Modelle auf EKS hinter Triton ausgeliefert und betrieben, mit bis zu 2.800 Anfragen pro Sekunde in Spitzenzeiten bei 95 ms p99. |
| CI/CD-Pipelines gebaut. | 18 Trainingspipelines auf Airflow mit gemeinsamem Basisimage als Vorlage vereinheitlicht; Zeit von der gemergten Modelländerung bis zum Live-Endpoint von 9 Tagen auf 6 Stunden verkürzt. |
| Mit Kubernetes gearbeitet. | 3 EKS-Cluster mit Karpenter-Autoscaling und 70 % Spot-Anteil für Trainingsjobs betrieben; GPU-Auslastung über 65 % gehalten und monatliche Rechenkosten um 38 % gesenkt. |
| Modelle überwacht. | Alerts für Feature-Drift und Vorhersageverteilung auf 22 Modellen mit Evidently und Prometheus eingeführt; drei vorgelagerte Datenfehler entdeckt, bevor sie geschäftliche Folgen hatten. |
| Einen Feature Store implementiert. | Feast für 6 Teams mit Paritätstests zwischen Offline und Online eingeführt, die vor dem Release eine Abweichung zwischen Training und Serving bei 2 Betrugsmodellen aufdeckten. |
| Retraining automatisiert. | Zeitgesteuertes und driftgesteuertes Retraining für 9 Modelle eingerichtet, mit automatischer Shadow-Evaluation gegen das Live-Modell und Rollback mit einem Befehl. |
| Zuverlässigkeit verbessert. | 14 Runbooks geschrieben und SLOs für das Serving eingeführt; mittlere Wiederherstellungszeit bei Inferenz-Vorfällen in zwei Quartalen von 52 auf 19 Minuten gesenkt. |
| Inferenz optimiert. | 7 PyTorch-Modelle nach ONNX konvertiert und Dynamic Batching aktiviert; Durchsatz pro GPU verdreifacht und 4 Nodes aus dem Serving-Pool entfernt. |
Kenntnisse im MLOps-Lebenslauf, gruppiert wie in Stellenanzeigen
Gruppieren Sie die Liste. Recruiterinnen und Recruiter ebenso wie Schlüsselwortfilter finden so schneller, was sie suchen, und eine gruppierte Liste verhindert, dass Sie eine ganze Cloud beanspruchen, wenn Sie zwei Dienste daraus genutzt haben.
- Orchestrierung und Infrastruktur: Kubernetes, Helm, Terraform, Docker, ArgoCD, GitHub Actions oder GitLab CI, Ansible
- Pipeline-Orchestrierung: Airflow, Kubeflow Pipelines, Argo Workflows, Prefect, Dagster, Metaflow
- Tracking und Registry: MLflow, Weights & Biases, DVC, Neptune
- Serving: KServe, Triton Inference Server, TorchServe, BentoML, Seldon, Ray Serve, vLLM für Sprachmodelle
- Features und Daten: Feast, Tecton, Spark, dbt, Kafka, Delta Lake, Great Expectations
- Überwachung und Monitoring: Prometheus, Grafana, OpenTelemetry, Evidently, WhyLabs, Arize
- Cloud: AWS (SageMaker, EKS, S3, IAM), GCP (Vertex AI, GKE), Azure ML. Schreiben Sie, welche Sie in der Tiefe kennen und welche Sie nur gestreift haben.
- Sprachen: zuerst Python, dann Go, Bash, SQL. Vermerken Sie, wo Sie Produktivservices geschrieben haben und nicht nur Skripte.
- Frameworks, die Sie unterstützen: PyTorch, TensorFlow, scikit-learn, XGBoost, Hugging Face Transformers
- Praktiken: GitOps, Blue-Green- und Canary-Releases, Shadow Deployment, Modellversionierung, reproduzierbare Builds, Daten- und Modell-Lineage, Kostenmanagement; in regulierten Umfeldern auch Dokumentation und Protokollierung, etwa mit Blick auf die EU-KI-Verordnung (AI Act), soweit sie für das jeweilige System gilt
Ein ehrlicher Satz schlägt eine lange Liste. Wenn Sie nie ein Modell trainiert haben, setzen Sie PyTorch nicht unter Kenntnisse; schreiben Sie stattdessen in einen Stichpunkt „Betrieb von PyTorch- und TensorFlow-Workloads in Produktion“. In diesem Feld wird im Gespräch nachgefragt, und die Lücke zeigt sich schnell.
GitHub, Homelab und die Version ohne bisherige MLOps-Stelle
Viele suchen danach, wie sie an die erste MLOps-Stelle kommen. Es ist einer der wenigen Engineering-Berufe, in denen ein gut gebautes eigenes Projekt wirklich hilft, denn ein Großteil der Arbeit besteht darin, Systeme miteinander zu verbinden, und das lässt sich mit wenig Geld zu Hause nachbauen.
- 1Bauen Sie ein durchgängiges Projekt und beschreiben Sie es wie eine Stelle. Datenaufnahme, Trainingspipeline, Registry, containerisiertes Serving, Monitoring-Dashboard, automatisches Retraining. Setzen Sie den Link zum Repository in den Kopf.
- 2Geben Sie ihm Zahlen. „Bedient 40 Anfragen pro Sekunde auf einem einzelnen Node mit 2 Kernen bei 60 ms p95, Retraining wöchentlich, Alerts bei Drift.“ Erst Zahlen machen ein eigenes Projekt als Engineering lesbar.
- 3Zeigen Sie den Infrastruktur-Code. Recruiterinnen, Recruiter und Interviewende öffnen Terraform- und Helm-Dateien häufiger als Notebooks.
- 4Zertifikate haben hier für Quereinsteigerinnen und Quereinsteiger ungewöhnlich viel Gewicht. Der Certified Kubernetes Administrator, die Machine-Learning-Zertifikate von AWS oder Google Cloud und der Terraform Associate passen direkt auf die Anforderungen in Anzeigen. Prüfen Sie vorher den aktuellen Namen, denn Anbieter benennen Zertifikate um oder stellen sie ein.
- 5Wenn Sie aus der Data Science wechseln, schreiben Sie Ihre bisherige Arbeit in Plattformsprache um: wie Modelle ausgeliefert wurden, wer sie genutzt hat, was kaputtging, wie Sie sie überwacht haben. Lassen Sie Genauigkeitswerte weg, es sei denn, sie erklären eine Plattformentscheidung.
- 6Wenn Sie aus DevOps wechseln, ergänzen Sie das ML-Vokabular, mit dem Sie schon zu tun haben: Artefaktversionierung, GPU-Scheduling, Batch-Trainingsjobs, Experiment-Tracking, Drift.
Durchgängigen Empfehlungsdienst auf einem k3s-Cluster mit 3 Nodes gebaut: wöchentliches Retraining mit Airflow, MLflow Registry, Serving mit BentoML bei 60 ms p95, Drift-Alerts in Grafana. Infrastruktur in Terraform, öffentliches Repository mit 40 Sternen.
12 Prognosemodelle, die bisher von Hand in Notebooks liefen, containerisiert und als zeitgesteuerte Airflow-Jobs mit versionierten Artefakten ausgeliefert; den monatlichen Reporting-Lauf von zwei Tagen auf 40 Minuten verkürzt.
GPU-Node-Gruppen und Karpenter-Autoscaling in zwei EKS-Clustern für das Data-Science-Team ergänzt, dann das gemeinsame Trainingsimage und die Job-Vorlage gebaut, die heute 4 Teams nutzen.
Aufbau, Länge und der Weg durch den Filter
- Eine Seite bei weniger als 10 Jahren Erfahrung. Zwei Seiten, wenn Sie mehrere Plattformaufbauten beschreiben können. Eine dritte Seite liest in diesem Feld niemand.
- Reihenfolge: Kopf mit GitHub-Link, Profil, Berufserfahrung, gruppierte Kenntnisse, Zertifikate, Ausbildung. Projekte stehen nur dann über der Berufserfahrung, wenn Sie noch keine passende Stelle hatten.
- Eine Spalte, schlichter Text, keine Kenntnisbalken, keine Bewertungspunkte. Engineering-Leitungen mögen sie nicht, und Parser zerlegen sie.
- Schreiben Sie Werkzeuge so, wie die Projekte sie schreiben: Kubernetes statt K8s in der Kenntnisliste (im Stichpunkt geht K8s), MLflow mit kleinem f, PyTorch mit großem T, scikit-learn klein.
- Nennen Sie Abkürzung und Langform einmal gemeinsam, wenn ein Filter nach beidem suchen könnte: CI/CD, IaC (Infrastructure as Code), LLM (Large Language Model).
- Übernehmen Sie die Begriffe der Anzeige: Model Deployment, Model Serving, Inferenz, Trainingspipeline, Feature Store, Model Registry, Drift, Observability, GPU, Autoscaling, Kostenoptimierung, Rufbereitschaft.
- PDF mit dem Namen Vorname-Nachname-MLOps-Engineer-Lebenslauf.pdf. Setzen Sie den GitHub-Link als Text ein, nicht nur als Hyperlink, damit er Kopieren und Einfügen übersteht.
- Ein Foto ist in Deutschland üblich, aber freiwillig, ebenso das Geburtsdatum; in internationalen Tech-Teams wird beides oft weggelassen. Viele dieser Unternehmen sprechen vom CV und erwarten eine englische Fassung. Für Stellen in den USA gilt: Resume, kein Foto, kein Geburtsdatum.
Häufige Fragen
Was muss ein Lebenslauf als MLOps Engineer zeigen?
Modelle in Produktion und die Systeme drumherum. Nennen Sie, wie viele Modelle Sie ausgeliefert haben, den Serving-Stack, Latenz, Durchsatz und Kosten sowie Ihre Werkzeuge für Pipelines, Registry und Monitoring. Ergänzen Sie Rufbereitschaft und Arbeit an Vorfällen, wenn vorhanden. Modellgenauigkeit gehört in einen Data-Science-Lebenslauf, nicht in diesen.
Welche Kenntnisse gehören in einen MLOps-Lebenslauf?
Kubernetes, Docker, Terraform, eine Cloud in der Tiefe, Python, ein Pipeline-Orchestrator wie Airflow oder Kubeflow, MLflow oder eine vergleichbare Registry, ein Serving-Framework wie KServe oder Triton und Monitoring mit Prometheus und einem Drift-Werkzeug. Gruppieren Sie sie und markieren Sie, was Sie täglich nutzen.
Wie wechsle ich im Lebenslauf von Data Scientist zu MLOps Engineer?
Schreiben Sie Ihren Werdegang um Deployment statt um Modellierung herum: was Sie containerisiert, zeitgesteuert, versioniert und überwacht haben und wer es genutzt hat. Ergänzen Sie Infrastrukturarbeit, auch kleine Teile. Eine Kubernetes-Zertifizierung und ein durchgängiges eigenes Projekt schließen den Großteil der Glaubwürdigkeitslücke.
Brauche ich Zertifikate für eine MLOps-Stelle?
Sie sind freiwillig, helfen hier aber mehr als in den meisten Engineering-Bereichen, besonders beim Wechsel. Der Certified Kubernetes Administrator, ein Machine-Learning-Zertifikat von AWS oder Google Cloud und der Terraform Associate passen direkt auf das, was Anzeigen verlangen. Nennen Sie nur gültige oder erneuerte Zertifikate mit ihrem aktuellen Namen.
Wie schreibe ich einen MLOps-Lebenslauf ohne Erfahrung?
Bauen und beschreiben Sie ein durchgängiges Projekt: Trainingspipeline, Registry, containerisiertes Serving, Monitoring und automatisches Retraining, mit der Infrastruktur in Terraform. Geben Sie echte Zahlen zu Latenz und Durchsatz an, setzen Sie den Link zum Repository in den Kopf und ergänzen Sie eine Kubernetes- oder Cloud-Zertifizierung.
Sollte ich einen GitHub-Link mit MLOps-Projekten in den Lebenslauf setzen?
Ja, wenn die Repositories Infrastruktur- und Pipeline-Code zeigen und ein lesbares README haben. Ein leeres oder verwaistes Profil schadet mehr als kein Link. Ein gutes Repository mit Diagramm und Installationsanleitung ist mehr wert als zwanzig Forks.
Wie lang sollte ein Lebenslauf als MLOps Engineer sein?
Für die meisten eine Seite, zwei, wenn Sie mehrere Plattformen betrieben haben. Halten Sie Profil, aktuelle Stelle und gruppierte Kenntnisse auf Seite eins, denn das überfliegt eine Leitung, bevor sie entscheidet, den Rest zu lesen.
Bereit für Ihren eigenen Lebenslauf?
Der Editor schlägt Ihnen ein Kurzprofil auf Basis Ihrer Erfahrung vor und gleicht es anschließend mit der Stellenanzeige ab.
So ist diese Seite entstanden: Ein erster Entwurf wurde mit KI-Unterstützung aus der Beispielbibliothek von cvplex erstellt und anschließend von cvplex Careers Team redigiert und auf Fakten geprüft. Die Beispiele sind fiktive Zusammenstellungen, die Zahlen dienen nur der Veranschaulichung. Fehler können Sie über die Seite zu unseren redaktionellen Richtlinien melden. Diese Sprachversion wurde mit KI-Unterstützung aus dem Englischen übersetzt.