Data Engineer
Summary
Builds and maintains data pipelines on GCP, develops PySpark transformations, and designs lakehouse layers in BigQuery for a large Polish bank’s data-driven transformation.
Informacje o projekcie:
Branża: Bankowość
Umowa: B2B
Stawka: do 158 pln/h netto +vat
Lokalizacja: hybryda Warszawa - 2 x tydzień
Wprowadzenie i podsumowanie:
Poszukujemy ekspertów, którzy chcą współtworzyć nowy ekosystem danych w jednym z największych banków w Polsce. Celem tej roli jest wdrożenie nowoczesnej platformy danych na Google Cloud Platform (GCP), budowa rozwiązania klasy data lakehouse oraz integracja obszarów raportowania, analityki oraz zarządzania danymi, w ramach strategicznego programu „data-driven bank”.
Główne obowiązki obejmują:
Budowa i utrzymanie pipeline'ów danych w dbt oraz orkiestracja przepływów w Airflow.
Rozwój komponentów przetwarzania danych w Pythonie oraz PySpark.
Projektowanie i rozwój warstw Gold i Platinum platformy lakehouse w BigQuery.
Optymalizacja wydajności i kosztów w BigQuery.
Budowa i utrzymanie procesów CI/CD oraz infrastruktury jako kodu.
Implementacja modelu bezpieczeństwa danych.
Współtworzenie standardów Data Governance.
Udział w code review i kształtowaniu standardów pracy zespołu.
Konsultacje techniczne dla zespołów domenowych oraz promowanie dobrych praktyk inżynierii danych na GCP.
Wymagania:
Min. 5 lat doświadczenia komercyjnego w inżynierii danych, w tym min. 2 lata w projektach opartych o Google Cloud Platform.
Udział w projektowaniu i wdrożeniu hurtowni danych w środowisku produkcyjnym o dużej skali.
Umiejętność projektowania rozwiązań end-to-end i uzasadniania decyzji architektonicznych.
SQL (poziom zaawansowany) — złożone zapytania analityczne.
Python (poziom zaawansowany) — programowanie obiektowe, pisanie modułów produkcyjnych.
Znajomość Google Cloud Platform: IAM, Cloud Storage, Cloud Logging/Monitoring.
BigQuery — projektowanie schematów, optymalizacja kosztów.
dbt (Core lub Cloud) — budowanie modeli, dokumentacja.
Apache Airflow — projektowanie DAG-ów produkcyjnych.
Apache Spark — pisanie zadań PySpark.
CI/CD — GitHub Actions, automatyzacja testów.
Git — biegłość w pracy z gałęziami.
Mile widziane:
Infrastructure as Code — Terraform.
Data Governance / Knowledge Catalog — Dataplex, zarządzanie metadanymi.
Docker — konteneryzacja aplikacji.
FinOps — optymalizacja kosztów w GCP.
Architektura medallion / data mesh.
Certyfikaty GCP — Professional Data Engineer.
Szczegóły kontekstu:
Praca w projekcie skupionym na budowie ekosystemu danych w chmurze, z zespołem w modelu hub & spoke.