freiberufler Senior Data & AI Engineer with 10+ years experience in scalable cloud-native platforms auf freelance.de

Senior Data & AI Engineer with 10+ years experience in scalable cloud-native platforms

zuletzt online vor 1 Tagen
  • auf Anfrage
  • 22391 Hamburg
  • Europa
  • ur  |  en
  • 25.09.2026
  • Contract ready

Kurzvorstellung

Senior Data Engineer mit 10+ Jahren Erfahrung in Databricks, Azure, AWS und Snowflake. Spezialisiert auf skalierbare Lakehouse-Pipelines, Terraform-Automatisierung und Migration von SQL-/Oracle-Systemen für BI und KI.

Geschäftsdaten

 Freiberuflich
 Steuernummer bekannt
 Berufshaftpflichtversicherung aktiv

Qualifikationen

  • Databricks3 J.
  • Microsoft Azure1 J.
  • Snowflake2 J.
  • Amazon Web Services (AWS)
  • Apache Hadoop4 J.
  • Apache Kafka6 J.
  • Apache Spark7 J.
  • ETL1 J.
  • Python4 J.
  • SQL6 J.

Projekt‐ & Berufserfahrung

Senior Data, Platform & AI Engineer | Databricks | Data Migration | Lakehouse Architecture
DeLaval
6/2025 – offen (1 Jahr, 4 Monate)
nicht angegeben
Tätigkeitszeitraum

6/2025 – offen

Tätigkeitsbeschreibung

Leitung des Designs und Betriebs einer Databricks-zentrierten Unternehmensdatenplattform zur Unterstützung groß angelegter Analysen, Datenengineering, Migration und ML-ready Workloads in einer regulierten industriellen Umgebung. Architektur von migrationsbereiten Lakehouse-Lösungen mit Medallion-Architektur (Bronze, Silver, Gold) zur Unterstützung skalierbarer Ingestion, Transformation, Datenqualität, Abgleich und geregelter Nutzung. Entwicklung von Source-to-Target-Mappings, Datenflussmustern und Transformationsschichten für Unternehmensdaten in mehreren Geschäftsbereichen. Aufbau skalierbarer Batch- und Streaming-Pipelines mit Databricks, Spark, PySpark, Spark SQL, Kafka, Delta Live Tables, Auto Loader und Delta Lake. Implementierung von Datenqualitätsregeln, Schema-Enforcement, Lineage und Abgleichprüfungen zur Gewährleistung zuverlässiger Datenlieferung. Entwicklung wiederverwendbarer Python-, PySpark- und SQL-basierter Datenengineering-Frameworks zur Standardisierung von Ingestion, Transformation, Validierung und Bereitstellung. Optimierung von Spark SQL- und Databricks-Workloads durch Verbesserung von Partitionierung, Join-Strategien, Dateilayout, inkrementeller Verarbeitung und Pipeline-Ausführungsleistung. Integration von Unity Catalog zur Durchsetzung von Zugriffskontrollen, Lineage, Governance, Auditierbarkeit und sicherem Datenaustausch. Design von CI/CD-ready Datenpipelines mit Terraform, GitHub Actions, automatisierten Tests und umgebungsbasierten Bereitstellungsworkflows.

Eingesetzte Qualifikationen

Databricks, Apache Spark, Apache Kafka, Unity3D, Architektur, Continuous Integration, Python, SQL

Senior Data & AI Platform Engineer
Mars
1/2024 – 5/2025 (1 Jahr, 5 Monate)
nicht angegeben
Tätigkeitszeitraum

1/2024 – 5/2025

Tätigkeitsbeschreibung

Design und Betrieb von unternehmensweiten Azure Databricks- und Azure Machine Learning-Plattformen zur Unterstützung von Analysen, ML und GenAI-Initiativen in regulierten Umgebungen. Aufbau von End-to-End-ML-Pipelines mit Azure ML Pipelines, Databricks und dbt mit automatisierten Datentransformationen, Feature Engineering, Training, Validierung und Bereitstellungsworkflows. Implementierung des Model-Lifecycle-Managements mit Azure ML Model Registry und MLflow zur kontrollierten Versionierung, Genehmigung und Förderung über verschiedene Umgebungen hinweg. Design und Wartung von Feature-Engineering-Pipelines mit Databricks Feature Store für Batch- und Echtzeit-Inferenz. Implementierung von Delta Live Tables zur Standardisierung, Automatisierung und Governance von ML-Datenpipelines mit integrierten Qualitätsprüfungen und Lineage. Integration von Azure OpenAI Service, Azure AI Studio und Cognitive Services für Unternehmens-NLP, Dokumentenintelligenz und GenAI-Anwendungsfälle. Bereitstellung von ML-Modellen auf AKS und Azure Container Apps mit Blue-Green-, Canary- und Shadow-Bereitstellungsstrategien. Implementierung von AI-fokussierten CI/CD- und DevOps-Workflows mit Azure DevOps, GitHub Actions, GitOps, Terraform und automatisierten Validierungsgates für Daten, ML und GenAI-Systeme. Einrichtung von Model-Monitoring, Drift-Erkennung und Observability mit Azure Monitor, Application Insights, MLflow-Metriken und benutzerdefinierten Dashboards. Durchsetzung von Responsible AI, Daten- und Model-Lineage sowie Governance mit Unity Catalog, Microsoft Purview, Azure Policy und rollenbasierten Zugriffskontrollen.

Eingesetzte Qualifikationen

Databricks, Microsoft Azure, Unity3D

Senior Data Engineer
Amazon
4/2023 – 12/2023 (9 Monate)
nicht angegeben
Tätigkeitszeitraum

4/2023 – 12/2023

Tätigkeitsbeschreibung

Design und Betrieb von Produktions-ML- und GenAI-Plattformen auf AWS zur Gewährleistung von Skalierbarkeit, Zuverlässigkeit, Sicherheit und Observability. Aufbau von Unternehmens-Data-Lakes und ML-Pipelines mit S3, AWS Glue, EMR, Redshift, Athena und Step Functions für automatisierte Ingestion, Transformation, Analysen und ML-Workloads. Implementierung von Feature-Engineering-Pipelines mit SageMaker Feature Store und geregelten Lakehouse-Mustern für reproduzierbare ML-Workflows. Integration von AWS Bedrock zur Bereitstellung und Governance von Foundation Models für GenAI, NLP, RAG und Dokumentenintelligenz-Anwendungsfälle. Aufbau von Echtzeit- und Batch-Inferenzsystemen mit SageMaker Endpoints, Lambda, API Gateway, ECS/EKS und Auto-Scaling. Implementierung von CI/CD und MLOps/LLMOps mit GitHub Actions, AWS CodePipeline, Terraform/CDK zur Ermöglichung automatisierter Tests, sicherer Bereitstellungen und Rollbacks. Design von IAM-, Netzwerk- und Sicherheitsarchitekturen mit Least-Privilege-IAM-Rollen, KMS, Secrets Manager, VPC, privaten Endpunkten und Datenverschlüsselung. Einrichtung von Model Registry, Monitoring und Drift-Erkennung mit SageMaker Model Registry, Model Monitor, CloudWatch und MLflow.

Eingesetzte Qualifikationen

Funktionale Programmierung

Senior Data Engineer
LGIM, Riga
3/2022 – 3/2023 (1 Jahr, 1 Monat)
nicht angegeben
Tätigkeitszeitraum

3/2022 – 3/2023

Tätigkeitsbeschreibung

Aufbau und Betrieb von unternehmensweiten, Snowflake-zentrierten Datenplattformen in einer regulierten Finanzumgebung unter Nutzung von Data-Mesh-Architektur zur Ermöglichung domänenorientierter, selbstbedienungsfähiger Datenprodukte mit starker Governance, Auffindbarkeit und Lineage. Design und Optimierung von Datenpipelines mit Snowflake (einschließlich Cortex), Azure Databricks, ADF, NiFi und dbt zur Unterstützung von Batch-, Streaming- und Echtzeit-Workflows in mehreren Geschäftsbereichen. Aufbau und Wartung von Airflow DAGs zur Orchestrierung von dbt-Transformationen, Snowflake-Aufgaben und Ingestion-Jobs in mehreren Geschäftsbereichen. Implementierung von Airflow-Sensoren und Task-Abhängigkeiten zur Koordination von systemübergreifenden Datenpipelines, Reduzierung manueller Übergaben und Pipeline-Ausfälle. Implementierung von Feature- und Dataset-Engineering-Pipelines zur Erstellung wiederverwendbarer, versionierter und geregelter Datenprodukte für Analysen und ML-Anwendungsfälle. Durchsetzung von Daten-Governance, Zugriffskontrolle, Lineage, Auditierbarkeit und Compliance mit Collibra, Unity Catalog und Cortex-Metadaten zur Gewährleistung unternehmensweiter Nachverfolgbarkeit und regulatorischer Einhaltung. Optimierung von Spark- und Databricks-Workloads für zuverlässige Datentransformationen, Ingestion und Lieferung im großen Maßstab. Einrichtung von Monitoring, Alerting und Observability für Datenpipelines, Lakehouse-Betrieb und domänenübergreifende Datenprodukte.

Eingesetzte Qualifikationen

Snowflake, Databricks, Bauingenieur / Architekt, Unity3D, Apache Spark, Governance

Senior BI Engineer
Grover, Berlin
12/2020 – 2/2022 (1 Jahr, 3 Monate)
nicht angegeben
Tätigkeitszeitraum

12/2020 – 2/2022

Tätigkeitsbeschreibung

Design, Implementierung und Optimierung von ELT/ETL-Pipelines mit Matillion, dbt, Snowflake und AWS Glue zur Bereitstellung hochwertiger, ML-ready und analysereifer Datensätze in mehreren Geschäftsbereichen. Aufbau von Feature-orientierten und dimensionalen Datenmodellen mit dbt zur Ermöglichung von Self-Service-Analysen und ML-Experimenten bei gleichzeitiger Gewährleistung vollständiger Lineage, Dokumentation und Governance. Implementierung von Streaming- und Batch-Datenpipelines mit Kafka, AWS Kinesis und S3 zur Gewährleistung von Dateningestion mit niedriger Latenz und zuverlässiger Lieferung an Analysen- und ML-Teams. Entwicklung kuratierter Datensätze und Dashboards in Power BI zur Bereitstellung handlungsrelevanter Erkenntnisse für Geschäfts-, Betriebs- und ML-Stakeholder. Automatisierung von Pipeline-Ausführung, Monitoring, Fehlerbehandlung und Datenqualitätsvalidierung mit AWS-Diensten, Matillion-Orchestrierung und Snowflake-Aufgaben zur Reduzierung manueller Eingriffe und Verbesserung der Pipeline-Zuverlässigkeit. Standardisierung von Dataset-Besitz, Zugriffskontrolle und Governance mit Collibra, Unity Catalog und internen Richtlinien zur Ermöglichung unternehmensweiter Datenauffindbarkeit und Compliance. Optimierung von Datentransformationen und Abfrageleistung in Snowflake und Databricks zur Verbesserung der Dashboard-Reaktionsfähigkeit und ML-Trainingsgeschwindigkeit.

Eingesetzte Qualifikationen

ETL, Snowflake, Apache Kafka, Streaming, Power Bi, Datenmodelierung, Unity3D

Senior Big Data Engineer
Accenture, Riga
7/2018 – 9/2021 (3 Jahre, 3 Monate)
nicht angegeben
Tätigkeitszeitraum

7/2018 – 9/2021

Tätigkeitsbeschreibung

Design und Implementierung groß angelegter GCP-Datenplattformen zur Unterstützung von Unternehmensanalysen, Berichterstattung, maschinellem Lernen und Near-Echtzeit-Datenverarbeitungsanwendungsfällen. Unterstützung der Modernisierung von Legacy-Datenwarehouses und Cloud-Datenmigrationsinitiativen, einschließlich Migrationsbewertung, Source-to-Target-Mapping, ETL-Konvertierung, Datenvalidierung, Abgleich und Workload-Optimierung. Aufbau skalierbarer Batch- und Streaming-Datenpipelines mit BigQuery, Dataproc, Dataflow, Pub/Sub, Spark, PySpark, Kafka und Google Cloud Storage. Migration und Optimierung von Legacy-Hadoop-, Hive- und Spark-Workloads in cloud-native GCP-Verarbeitungsmuster mit Dataproc, Dataflow und BigQuery. Orchestrierung von Batch- und Streaming-Pipelines mit Apache Airflow / Cloud Composer, Planung von BigQuery-, Dataproc- und Dataflow-Jobs mit Abhängigkeitsmanagement und Wiederholungslogik. Design optimierter BigQuery-Datenmodelle mit Partitionierung, Clustering, Denormalisierung und workloadspezifischem Tabellendesign zur Verbesserung der Abfrageleistung und Reduzierung der Verarbeitungskosten. Durchführung von fortgeschrittener SQL-Optimierung und Spark-Workload-Optimierung durch Analyse von Ausführungsplänen, Verbesserung von Joins, Reduzierung von Datenverzerrungen, Optimierung von Partitionierungsstrategien und Minimierung unnötiger Datenscans. Entwicklung wiederverwendbarer Ingestion- und Transformations-Frameworks mit Python, SQL, Spark und GCP-Diensten für strukturierte, semi-strukturierte, Batch- und Streaming-Daten. Unterstützung von Daten-Streaming-Initiativen mit Pub/Sub, Kafka, Spark Streaming und Dataflow zur Ermöglichung von Near-Echtzeit-Analysen und Downstream-Datenprodukten.

Eingesetzte Qualifikationen

Google Cloud, Apache Spark, Apache Kafka, SQL, Apache Hadoop, Python

Big Data Engineer
Teradata, Islamabad
8/2016 – 2/2018 (1 Jahr, 7 Monate)
nicht angegeben
Tätigkeitszeitraum

8/2016 – 2/2018

Tätigkeitsbeschreibung

Arbeit an Unternehmens-Datenwarehouse- und Big-Data-Modernisierungsprojekten mit Teradata, Hadoop, Spark, Hive, Cloudera, NiFi, Kafka und Oracle-basierten Legacy-Umgebungen. Unterstützung von Teradata-Legacy-Datenwarehouse-Umgebungen, einschließlich Datenextraktion, SQL-Analyse, Workload-Bewertung, Migrationsplanung und Cloud-Modernisierungsvorbereitung. Entwicklung und Optimierung komplexer Teradata-SQL-Abfragen für große analytische Workloads mit Fokus auf Join-Leistung, Statistiken, Partitionierung, Spool-Nutzung, Datenverteilung und Ausführungseffizienz. Unterstützung von Teradata-zu-Cloud-Migrationsmustern, einschließlich Source-Analyse, Datenprofilierung, Source-to-Target-Mapping, Bulk-Extraktion, Transformations-Redesign, Validierung und Abgleich. Aufbau groß angelegter Ingestion-Pipelines von Teradata, Oracle und relationalen Quellsystemen in Hadoop/Spark-basierte Data-Lake-Umgebungen für Analysen und Berichterstattung. Verwendung von Teradata-Ökosystem-Tools und -Utilities wie FastLoad, MultiLoad/TPT, BTEQ, SQL Assistant und Bulk-Export/Import-Mustern für Hochvolumen-Datenbewegungen und -validierung. Implementierung von inkrementeller Ingestion, CDC-ähnlicher Verarbeitung und Abgleich-Workflows zur Gewährleistung der Konsistenz zwischen Quellsystemen und Ziel-Analyseplattformen. Migration von Legacy-ETL-Logik zu Spark-basierter Verarbeitung zur Verbesserung von Skalierbarkeit, Wartbarkeit, Ausführungsgeschwindigkeit und operativer Zuverlässigkeit. Integration von Kafka und NiFi für Streaming-Ingestion und ereignisgesteuerte Datenworkflows zur Unterstützung von Low-Latency- und zuverlässiger Datenlieferung. Optimierung von Hive-Abfragen, Spark-Jobs, HDFS-Speicherlayouts und Teradata-SQL-Workloads für Leistung, Kosteneffizienz und groß angelegte Analysen.

Eingesetzte Qualifikationen

Teradata Sql, Apache Hadoop, Apache Spark, Apache Kafka, Oracle-Anwendungen, SQL

Ausbildung

International Islamic University Islamabad
Bachelor of Science in Software Engineering
2016
Islamabad

Über mich

Ich bin ein erfahrener Senior GCP Data Architect und Data Engineer mit über 10 Jahren Erfahrung in der Gestaltung, dem Aufbau und der Modernisierung von unternehmensweiten Cloud-Datenplattformen, Data Lakes, Data Warehouses und Big-Data-Architekturen auf GCP, Databricks, Teradata, Oracle, Hadoop, AWS, Azure und Snowflake. Meine Expertise umfasst groß angelegte Datenmigrationen und Modernisierungsprogramme, einschließlich der Migration von Teradata zu BigQuery, Oracle/Exadata-Modernisierung, Cloud-Datenbankmigration, Data-Lake-Migration, Source-to-Target-Mapping, ETL/ELT-Migration, Datenabgleich und Produktions-Cutover-Planung. Ich verfüge über fundierte praktische Erfahrungen mit dem GCP-Datenökosystem, einschließlich BigQuery, Dataproc, Dataflow, Pub/Sub, GCS, Cloud Composer und Cloud Monitoring, sowie mit modernen Big-Data-Plattformen wie Databricks, Spark, PySpark, Kafka, Delta Lake und Hadoop. Bekannt für fortgeschrittene SQL-Optimierung und Workload-Optimierung, habe ich komplexe analytische Workloads auf BigQuery, Teradata, Oracle, Spark SQL, Hive, Databricks und Snowflake optimiert, um Abfrageleistung, Skalierbarkeit, Kosteneffizienz und Zuverlässigkeit zu verbessern. Ich bin versiert in Python, Java, SQL, Scala und Bash und habe Erfahrung im Design von Batch- und Streaming-Datenarchitekturen zur Unterstützung von Unternehmensanalysen, Berichterstattung, maschinellem Lernen und Echtzeit-Dateninitiativen.

Persönliche Daten

Sprache
  • Urdu (Muttersprache)
  • Englisch (Fließend)
Reisebereitschaft
Europa
Arbeitserlaubnis
  • Europäische Union
  • Schweiz
Home-Office
bevorzugt
Profilaufrufe
15
Berufserfahrung
10 Jahre (seit 09/2016)
Projektleitung
5 Jahre

Kontaktdaten

Nur registrierte PREMIUM-Mitglieder von freelance.de können Kontaktdaten einsehen.

Jetzt Mitglied werden