Senior DevOps & Platform Engineer | Kubernetes, OpenStack, KI-/GPU-Infrastruktur
- Verfügbarkeit einsehen
- 0 Referenzen
- 70€/Stunde
- 60486 Frankfurt am Main
- National
- en | de | nl
- 08.09.2026
- Contract ready
Kurzvorstellung
Geschäftsdaten
Qualifikationen
Projekt‐ & Berufserfahrung
4/2024 – offen
Tätigkeitsbeschreibung
Verantwortlich für Infrastruktur, Deployment-Workflows, Observability und Plattformzuverlässigkeit einer Plattform zur Kubernetes-Kostenanalyse.
- Kubernetes-Cluster deklarativ über die Cluster API (CAPI/CAPO) bereitgestellt und über den gesamten Lebenszyklus verwaltet: Erstellung, Versions-Upgrades, Skalierung, Node-Rotation.
- Infrastructure as Code von Terraform auf OpenTofu umgestellt und wiederverwendbare Module für OpenStack-Ressourcen entwickelt (Nova, Neutron, Cinder, Glance, Octavia).
- Ansible-Rollen mit der Collection openstack.cloud und dynamischem Inventory für Provisionierung, OS-Hardening und wiederholbare Konfigurations-Rollouts.
- GPU-Knoten in die Kubernetes-Cluster integriert und betrieben: NVIDIA-Device-Plugin, GPU-Scheduling, Node-Labeling, Kapazitätsplanung sowie Zuordnung der GPU-Kosten je Team, Namespace und Workload.
- LLM-Inferenz mit vLLM und llama.cpp produktiv bereitgestellt, ausgeliefert als versionierte Helm-Charts mit Modellverwaltung, Ressourcenlimits und Health-Checks.
- MLOps-Pipelines für Modell-Deployment und -Aktualisierung: versionierte Modellartefakte, automatisierte Rollouts über GitLab CI/CD und GitOps, definierte Rollback-Pfade, Monitoring von Latenz, Durchsatz und GPU-Speicherauslastung.
- RAG-basierten Wissensassistenten vollständig on-premises betrieben, sodass Dokumente und Anfragen die Kundeninfrastruktur nicht verlassen.
- CI/CD-Automatisierung, Observability mit Prometheus, Grafana und Loki, Right-Sizing und Kostenzuordnung je Team, Namespace und Workload.
DevOps, MLOps, Docker, Python, Ansible, Kubernetes, Red Hat Enterprise Linux (RHEL)
4/2023 – 4/2024
Tätigkeitsbeschreibung
Betrieb und Optimierung containerisierter Workloads auf der STACKIT Kubernetes Engine (SKE) sowie auf der OpenStack-basierten IaaS-Ebene von STACKIT.
- Linux-basierte Workloads auf SKE-Clustern betrieben und optimiert – hohe Verfügbarkeit, effiziente Ressourcennutzung, geringe Latenz.
- Cluster-Lebenszyklus über die Cluster API verwaltet: Bereitstellung, Versions-Upgrades, Skalierung und Node-Rotation.
- Mit der OpenStack-IaaS-Ebene gearbeitet: Compute-Instanzen, private Netze und Router, Security Groups, Floating IPs, Block- und Object-Storage über OpenStack-APIs, CLI und Horizon.
- Infrastruktur deklarativ mit Terraform/OpenTofu und Ansible bereitgestellt und konfiguriert.
- End-to-End-Observability mit STACKIT Observability, Grafana-Dashboards und OpenTelemetry-kompatibler Datenerfassung implementiert.
- Zentralisierte Monitoring- und Logging-Pipelines für Systemlogs, journald und Anwendungstelemetrie aufgebaut und in Grafana korreliert.
- CI/CD-Zuverlässigkeit und Deployment-Geschwindigkeit über GitLab CI und Jenkins verbessert.
- Linux-Performance-Engpässe analysiert und behoben: CPU-Starvation, Memory-Leaks, Container-Throttling.
DevOps, Docker, Red Hat Enterprise Linux (RHEL), Ansible, Kubernetes, Openshift
6/2017 – 9/2021
Tätigkeitsbeschreibung
Aufbau und Betrieb der Linux- und OpenStack-Infrastruktur hinter der E-Commerce-Plattform sowie der zugehörigen CI/CD- und Monitoring-Landschaft.
- Linux-Infrastruktur auf OpenStack bereitgestellt und betrieben: Keystone-Projekte und Quotas, Nova-Instanzen und Flavors, Neutron-Netze, Router, Security Groups und Floating IPs, Cinder-Volumes, Glance-Images.
- Ressourcenbereitstellung über die OpenStack-APIs mit SaltStack, Ansible und Puppet automatisiert und Compliance durchgesetzt.
- CI/CD-Deployment-Pipelines mit Git, Bamboo, Artifactory, Docker und Kubernetes aufgebaut und gepflegt.
- SaltStack-Formeln für Konfigurationsmanagement und Drift-Korrektur der Linux-Infrastruktur erstellt und gepflegt.
- Eigene Ruby-Plugins für das Monitoring-System Sensu entwickelt und mit Redis, Elasticsearch und InfluxDB integriert.
- Interne Plattformdienste betrieben: Graylog, Sensu, Artifactory, Kafka und Bamboo, angebunden an Elasticsearch, Prometheus und Grafana.
- Linux-Systeme auf Performance und Zuverlässigkeit optimiert: systemd-Dienste, Journal-Logging, Kernelparameter, Ressourcenanalyse.
DevOps, Docker, Red Hat Enterprise Linux (RHEL), Ansible, Puppet, Kubernetes
Ausbildung
Hannover
Amsterdam
State University of Armenia
Yerevan
Über mich
PLATTFORM & INFRASTRUKTUR
Kubernetes im Produktivbetrieb inklusive Cluster API (CAPI/CAPO) für den deklarativen Cluster-Lebenszyklus, OpenShift, Helm und GitOps mit ArgoCD. Langjährige Praxis mit OpenStack und seinen Kernkomponenten – Keystone, Nova, Neutron, Cinder, Glance, Swift, Heat, Octavia, Horizon – beim Aufbau, Betrieb und Troubleshooting privater Cloud-Plattformen. Infrastructure as Code mit OpenTofu und Terraform, Konfigurationsmanagement und Provisionierung mit Ansible (Collection openstack.cloud, dynamisches Inventory), Chef, Puppet und SaltStack. CI/CD mit GitLab CI und Jenkins, Observability mit Prometheus, Grafana und Loki.
KI-INFRASTRUKTUR & MLOPS
Betrieb von GPU-Knoten unter Kubernetes: NVIDIA-Device-Plugin, GPU-Scheduling und Node-Labeling, Kapazitätsplanung der Beschleuniger sowie Zuordnung der GPU-Kosten je Team, Namespace und Workload. Produktive LLM-Inferenz mit vLLM und llama.cpp, ausgeliefert als versionierte Helm-Charts mit Modellverwaltung, Ressourcenlimits und Health-Checks. MLOps-Pipelines für Modell-Deployment und -Aktualisierung: versionierte Modellartefakte, automatisierte Rollouts über GitLab CI/CD und GitOps, definierte Rollback-Pfade sowie Monitoring von Latenz, Durchsatz und GPU-Speicherauslastung. RAG-Systeme vollständig on-premises, sodass Dokumente und Anfragen die Infrastruktur des Kunden nicht verlassen – ausgelegt auf Umgebungen mit Anforderungen an Datenhoheit und DSGVO-Konformität.
KOSTENTRANSPARENZ
Kosten- und Auslastungsanalyse für Kubernetes- und OpenStack-Umgebungen: Zuordnung der Kosten je Team, Namespace und Workload, Erkennung von Überprovisionierung, Right-Sizing von Nova-Flavors und Container-Requests, Quota-Verwaltung in Keystone-Projekten.
ARBEITSWEISE
Schwerpunkt Brownfield – bestehende Plattformen übernehmen, stabilisieren und automatisieren. Projektsprache Deutsch oder Englisch. Remote oder vor Ort in NRW, bundesweit reisebereit.
Weitere Kenntnisse
Persönliche Daten
- Englisch (Muttersprache)
- Deutsch (Fließend)
- Niederländisch (Grundkenntnisse)
- Europäische Union
Kontaktdaten
Nur registrierte PREMIUM-Mitglieder von freelance.de können Kontaktdaten einsehen.
Jetzt Mitglied werden
