freiberufler Senior DevOps & Platform Engineer | Kubernetes, OpenStack, KI-/GPU-Infrastruktur auf freelance.de

Senior DevOps & Platform Engineer | Kubernetes, OpenStack, KI-/GPU-Infrastruktur

online
  • 70€/Stunde
  • 60486 Frankfurt am Main
  • National
  • en  |  de  |  nl
  • 08.09.2026
  • Contract ready

Kurzvorstellung

Senior DevOps & Platform Engineer, 15+ Jahre: Kubernetes, OpenStack, OpenTofu/Terraform, Ansible. Schwerpunkt KI-Infrastruktur und MLOps – GPU-Knoten unter Kubernetes, LLM-Inferenz mit vLLM/llama.cpp, RAG on-premises mit voller Datenhoheit.

Geschäftsdaten

 Freiberuflich
 Steuernummer bekannt
 Berufshaftpflichtversicherung aktiv

Qualifikationen

  • Amazon Web Services (AWS)
  • Ansible7 J.
  • CI/CD
  • DevOps7 J.
  • Docker7 J.
  • Kubernetes7 J.
  • Microsoft Azure
  • MLOps2 J.
  • Python2 J.
  • Red Hat Enterprise Linux (RHEL)7 J.

Projekt‐ & Berufserfahrung

Senior DevOps / Platform Engineer – Kubernetes & KI-Infrastruktur
K8cost.com, Schwerte
4/2024 – offen (2 Jahre, 6 Monate)
IT & Entwicklung
Tätigkeitszeitraum

4/2024 – offen

Tätigkeitsbeschreibung

Verantwortlich für Infrastruktur, Deployment-Workflows, Observability und Plattformzuverlässigkeit einer Plattform zur Kubernetes-Kostenanalyse.

- Kubernetes-Cluster deklarativ über die Cluster API (CAPI/CAPO) bereitgestellt und über den gesamten Lebenszyklus verwaltet: Erstellung, Versions-Upgrades, Skalierung, Node-Rotation.
- Infrastructure as Code von Terraform auf OpenTofu umgestellt und wiederverwendbare Module für OpenStack-Ressourcen entwickelt (Nova, Neutron, Cinder, Glance, Octavia).
- Ansible-Rollen mit der Collection openstack.cloud und dynamischem Inventory für Provisionierung, OS-Hardening und wiederholbare Konfigurations-Rollouts.
- GPU-Knoten in die Kubernetes-Cluster integriert und betrieben: NVIDIA-Device-Plugin, GPU-Scheduling, Node-Labeling, Kapazitätsplanung sowie Zuordnung der GPU-Kosten je Team, Namespace und Workload.
- LLM-Inferenz mit vLLM und llama.cpp produktiv bereitgestellt, ausgeliefert als versionierte Helm-Charts mit Modellverwaltung, Ressourcenlimits und Health-Checks.
- MLOps-Pipelines für Modell-Deployment und -Aktualisierung: versionierte Modellartefakte, automatisierte Rollouts über GitLab CI/CD und GitOps, definierte Rollback-Pfade, Monitoring von Latenz, Durchsatz und GPU-Speicherauslastung.
- RAG-basierten Wissensassistenten vollständig on-premises betrieben, sodass Dokumente und Anfragen die Kundeninfrastruktur nicht verlassen.
- CI/CD-Automatisierung, Observability mit Prometheus, Grafana und Loki, Right-Sizing und Kostenzuordnung je Team, Namespace und Workload.

Eingesetzte Qualifikationen

DevOps, MLOps, Docker, Python, Ansible, Kubernetes, Red Hat Enterprise Linux (RHEL)

DevOps Cloud Engineer – STACKIT Kubernetes Engine & OpenStack
Schwarz IT, Neckarsulm
4/2023 – 4/2024 (1 Jahr, 1 Monat)
IT & Entwicklung
Tätigkeitszeitraum

4/2023 – 4/2024

Tätigkeitsbeschreibung

Betrieb und Optimierung containerisierter Workloads auf der STACKIT Kubernetes Engine (SKE) sowie auf der OpenStack-basierten IaaS-Ebene von STACKIT.

- Linux-basierte Workloads auf SKE-Clustern betrieben und optimiert – hohe Verfügbarkeit, effiziente Ressourcennutzung, geringe Latenz.
- Cluster-Lebenszyklus über die Cluster API verwaltet: Bereitstellung, Versions-Upgrades, Skalierung und Node-Rotation.
- Mit der OpenStack-IaaS-Ebene gearbeitet: Compute-Instanzen, private Netze und Router, Security Groups, Floating IPs, Block- und Object-Storage über OpenStack-APIs, CLI und Horizon.
- Infrastruktur deklarativ mit Terraform/OpenTofu und Ansible bereitgestellt und konfiguriert.
- End-to-End-Observability mit STACKIT Observability, Grafana-Dashboards und OpenTelemetry-kompatibler Datenerfassung implementiert.
- Zentralisierte Monitoring- und Logging-Pipelines für Systemlogs, journald und Anwendungstelemetrie aufgebaut und in Grafana korreliert.
- CI/CD-Zuverlässigkeit und Deployment-Geschwindigkeit über GitLab CI und Jenkins verbessert.
- Linux-Performance-Engpässe analysiert und behoben: CPU-Starvation, Memory-Leaks, Container-Throttling.

Eingesetzte Qualifikationen

DevOps, Docker, Red Hat Enterprise Linux (RHEL), Ansible, Kubernetes, Openshift

Senior DevOps Consultant – OpenStack Private Cloud & E-Commerce-Plattform
Parfümerie Douglas GmbH, Düsseldorf
6/2017 – 9/2021 (4 Jahre, 4 Monate)
Handel
Tätigkeitszeitraum

6/2017 – 9/2021

Tätigkeitsbeschreibung

Aufbau und Betrieb der Linux- und OpenStack-Infrastruktur hinter der E-Commerce-Plattform sowie der zugehörigen CI/CD- und Monitoring-Landschaft.

- Linux-Infrastruktur auf OpenStack bereitgestellt und betrieben: Keystone-Projekte und Quotas, Nova-Instanzen und Flavors, Neutron-Netze, Router, Security Groups und Floating IPs, Cinder-Volumes, Glance-Images.
- Ressourcenbereitstellung über die OpenStack-APIs mit SaltStack, Ansible und Puppet automatisiert und Compliance durchgesetzt.
- CI/CD-Deployment-Pipelines mit Git, Bamboo, Artifactory, Docker und Kubernetes aufgebaut und gepflegt.
- SaltStack-Formeln für Konfigurationsmanagement und Drift-Korrektur der Linux-Infrastruktur erstellt und gepflegt.
- Eigene Ruby-Plugins für das Monitoring-System Sensu entwickelt und mit Redis, Elasticsearch und InfluxDB integriert.
- Interne Plattformdienste betrieben: Graylog, Sensu, Artifactory, Kafka und Bamboo, angebunden an Elasticsearch, Prometheus und Grafana.
- Linux-Systeme auf Performance und Zuverlässigkeit optimiert: systemd-Dienste, Journal-Logging, Kernelparameter, Ressourcenanalyse.

Eingesetzte Qualifikationen

DevOps, Docker, Red Hat Enterprise Linux (RHEL), Ansible, Puppet, Kubernetes

Ausbildung

Amazon AWS Architect
Ausbildung
2014
Hannover
Puppet Master
Ausbildung
2014
Amsterdam
Bachelor's Degree
Bachelor's Degree
State University of Armenia
2005
Yerevan

Über mich

Senior DevOps & Platform Engineer mit mehr als 15 Jahren Erfahrung im Aufbau und Betrieb produktiver Linux- und Kubernetes-Infrastruktur. Projekte u.a. für SAP, Lufthansa Industry Solutions, eBay, Münchener Rück, Schwarz IT/STACKIT, Parfümerie Douglas und Elsevier.

PLATTFORM & INFRASTRUKTUR
Kubernetes im Produktivbetrieb inklusive Cluster API (CAPI/CAPO) für den deklarativen Cluster-Lebenszyklus, OpenShift, Helm und GitOps mit ArgoCD. Langjährige Praxis mit OpenStack und seinen Kernkomponenten – Keystone, Nova, Neutron, Cinder, Glance, Swift, Heat, Octavia, Horizon – beim Aufbau, Betrieb und Troubleshooting privater Cloud-Plattformen. Infrastructure as Code mit OpenTofu und Terraform, Konfigurationsmanagement und Provisionierung mit Ansible (Collection openstack.cloud, dynamisches Inventory), Chef, Puppet und SaltStack. CI/CD mit GitLab CI und Jenkins, Observability mit Prometheus, Grafana und Loki.

KI-INFRASTRUKTUR & MLOPS
Betrieb von GPU-Knoten unter Kubernetes: NVIDIA-Device-Plugin, GPU-Scheduling und Node-Labeling, Kapazitätsplanung der Beschleuniger sowie Zuordnung der GPU-Kosten je Team, Namespace und Workload. Produktive LLM-Inferenz mit vLLM und llama.cpp, ausgeliefert als versionierte Helm-Charts mit Modellverwaltung, Ressourcenlimits und Health-Checks. MLOps-Pipelines für Modell-Deployment und -Aktualisierung: versionierte Modellartefakte, automatisierte Rollouts über GitLab CI/CD und GitOps, definierte Rollback-Pfade sowie Monitoring von Latenz, Durchsatz und GPU-Speicherauslastung. RAG-Systeme vollständig on-premises, sodass Dokumente und Anfragen die Infrastruktur des Kunden nicht verlassen – ausgelegt auf Umgebungen mit Anforderungen an Datenhoheit und DSGVO-Konformität.

KOSTENTRANSPARENZ
Kosten- und Auslastungsanalyse für Kubernetes- und OpenStack-Umgebungen: Zuordnung der Kosten je Team, Namespace und Workload, Erkennung von Überprovisionierung, Right-Sizing von Nova-Flavors und Container-Requests, Quota-Verwaltung in Keystone-Projekten.

ARBEITSWEISE
Schwerpunkt Brownfield – bestehende Plattformen übernehmen, stabilisieren und automatisieren. Projektsprache Deutsch oder Englisch. Remote oder vor Ort in NRW, bundesweit reisebereit.

Weitere Kenntnisse

Kubernetes, OpenStack (Keystone, Nova, Neutron, Cinder, Glance, Octavia), Cluster API (CAPI/CAPO), OpenShift, Docker, Helm, Linux (RHEL, Debian, SUSE, CoreOS), systemd, OpenTofu, Terraform, Ansible, Chef, Puppet, SaltStack, GitLab CI/CD, Jenkins, ArgoCD, Kustomize, GitOps, Infrastructure as Code, Prometheus, Grafana, Loki, Elasticsearch, Observability, AWS, Azure, Site Reliability Engineering, FinOps / Kostenoptimierung, Hochverfügbarkeit, Disaster Recovery, Python, Bash, Ruby, Rust, Git, Scrum, KI-Infrastruktur, GPU-Cluster, NVIDIA GPU Operator, GPU-Scheduling, LLM-Inferenz, vLLM, llama.cpp, Model Serving, Retrieval-Augmented Generation (RAG), MLOps, On-Premises-KI, Souveräne Cloud, Datenhoheit, DSGVO-konforme KI-Architektur

Persönliche Daten

Sprache
  • Englisch (Muttersprache)
  • Deutsch (Fließend)
  • Niederländisch (Grundkenntnisse)
Reisebereitschaft
National
Arbeitserlaubnis
  • Europäische Union
Profilaufrufe
4767
Alter
43
Berufserfahrung
19 Jahre und 2 Monate (seit 07/2007)

Kontaktdaten

Nur registrierte PREMIUM-Mitglieder von freelance.de können Kontaktdaten einsehen.

Jetzt Mitglied werden