Data Engineer Databricks / Lakehouse bei unserer Tochtergesellschaft 1&1 Telecommunication SE in Karlsruhe oder Montabaur Kennziffer: SF-5634 (m/w/d)
Summary
Designs, builds, and operates ETL/ELT pipelines in PySpark on Databricks, migrating 1&1 Telecommunication's data warehouse off MS SQL Server to a scalable Lakehouse architecture with data quality checks, governance, and monitoring. Core stack: Python/PySpark, Apache Spark, Databricks, Delta Lake, Structured Streaming, SQL.
In dieser Rolle gestalten Sie die Transformation unserer Datenlandschaft zu einer skalierbaren Lakehouse-Architektur auf Databricks. Sie liefern die Grundlage für datengetriebene Entscheidungen und AI-Anwendungsfälle. Sie entwickeln ETL-/ELT-Pipelines in PySpark, migrieren von MS SQL Server/Stored Procedures, und implementieren Data Governance und Qualitätsprüfungen. Sie arbeiten eng mit BI, Analytics, Architektur und Fachbereichen zusammen, optimieren Pipelines in Performance und Kosten und dokumentieren nachvollziehbar.
Leistungen / Benefits- Attraktives Gehalt
- Starke Gemeinschaft
- Vertrauensarbeitszeit mit flexibler Einteilung und bis zu 40% remote
- Weiterbildungsmöglichkeiten on- und offline
- Rabatte auf 1&1 Produkte
- Betriebseigenes Restaurant
- Design, Entwicklung und Betrieb moderner ETL-/ELT-Pipelines auf Basis von Python (PySpark) in Databricks
- Ablösung bestehender Data-Warehouse- und ETL-Strukturen durch Lakehouse-Architekturen
- Aufbau differenzierter Pipeline-Logiken für Stabilität, SLA-Konformität und Auditierbarkeit
- Implementierung von Datenqualitätsprüfungen (Validierung, Reconciliation, Quality Checks)
- Sicherstellung der Datenkonsistenz während der Migration
- Umsetzung von Transformationen, Schema-Mappings und Metadaten-Anreicherung
- Optimierung von Datenpipelines hinsichtlich Performance, Kosten und Skalierbarkeit
- Nutzung moderner Databricks-Funktionalitäten (Delta Lake, Structured Streaming)
- Monitoring von Pipeline-Laufzeiten, Ressourcennutzung und Systemstabilität
- Enge Zusammenarbeit mit BI-, Analytics-, Architektur- und Entwicklungsteams sowie Fachbereichen
- Erstellung und Pflege technischer Dokumentation sowie Sicherstellung von Nachvollziehbarkeit und Governance
- Abgeschlossenes Studium in Informatik, Data Engineering, Wirtschaftsinformatik oder vergleichbar
- Mehrjährige Erfahrung (ca. 3–6 Jahre) im Data Engineering
- Sehr gute Python-Kenntnisse (insb. PySpark) sowie fundierte Erfahrung mit Apache Spark und idealerweise Databricks
- Starkes Verständnis von ETL-/ELT-Prozessen, Datenmodellierung und Pipeline-Orchestrierung
- Erfahrung mit Microsoft SQL Server sowie sehr gute SQL-Kenntnisse
- Analytische, strukturierte und lösungsorientierte Arbeitsweise
- Erfahrung mit Databricks Lakehouse, Delta Lake und Structured Streaming
- Kenntnisse in Orchestrierungstools (z. B. Airflow, Databricks Workflows)
- Verständnis von Data Governance, Compliance sowie Metadatenmanagement
- PySpark
- Apache Spark
- Databricks
- Delta Lake
- Structured Streaming
- Microsoft SQL Server