freehire launches on Product Hunt on 26 August.

Follow →

Data Engineer

Summary

Builds and maintains data pipelines on GCP, develops PySpark transformations, and designs lakehouse layers in BigQuery for a large Polish bank’s data-driven transformation.

Informacje o projekcie:

  • Branża: Bankowość

  • Umowa: B2B

  • Stawka: do 158 pln/h netto +vat

  • Lokalizacja: hybryda Warszawa - 2 x tydzień

Wprowadzenie i podsumowanie:

Poszukujemy ekspertów, którzy chcą współtworzyć nowy ekosystem danych w jednym z największych banków w Polsce. Celem tej roli jest wdrożenie nowoczesnej platformy danych na Google Cloud Platform (GCP), budowa rozwiązania klasy data lakehouse oraz integracja obszarów raportowania, analityki oraz zarządzania danymi, w ramach strategicznego programu „data-driven bank”.

Główne obowiązki obejmują:

  • Budowa i utrzymanie pipeline'ów danych w dbt oraz orkiestracja przepływów w Airflow.

  • Rozwój komponentów przetwarzania danych w Pythonie oraz PySpark.

  • Projektowanie i rozwój warstw Gold i Platinum platformy lakehouse w BigQuery.

  • Optymalizacja wydajności i kosztów w BigQuery.

  • Budowa i utrzymanie procesów CI/CD oraz infrastruktury jako kodu.

  • Implementacja modelu bezpieczeństwa danych.

  • Współtworzenie standardów Data Governance.

  • Udział w code review i kształtowaniu standardów pracy zespołu.

  • Konsultacje techniczne dla zespołów domenowych oraz promowanie dobrych praktyk inżynierii danych na GCP.

Wymagania:

  • Min. 5 lat doświadczenia komercyjnego w inżynierii danych, w tym min. 2 lata w projektach opartych o Google Cloud Platform.

  • Udział w projektowaniu i wdrożeniu hurtowni danych w środowisku produkcyjnym o dużej skali.

  • Umiejętność projektowania rozwiązań end-to-end i uzasadniania decyzji architektonicznych.

  • SQL (poziom zaawansowany) — złożone zapytania analityczne.

  • Python (poziom zaawansowany) — programowanie obiektowe, pisanie modułów produkcyjnych.

  • Znajomość Google Cloud Platform: IAM, Cloud Storage, Cloud Logging/Monitoring.

  • BigQuery — projektowanie schematów, optymalizacja kosztów.

  • dbt (Core lub Cloud) — budowanie modeli, dokumentacja.

  • Apache Airflow — projektowanie DAG-ów produkcyjnych.

  • Apache Spark — pisanie zadań PySpark.

  • CI/CD — GitHub Actions, automatyzacja testów.

  • Git — biegłość w pracy z gałęziami.

Mile widziane:

  • Infrastructure as Code — Terraform.

  • Data Governance / Knowledge Catalog — Dataplex, zarządzanie metadanymi.

  • Docker — konteneryzacja aplikacji.

  • FinOps — optymalizacja kosztów w GCP.

  • Architektura medallion / data mesh.

  • Certyfikaty GCP — Professional Data Engineer.

Szczegóły kontekstu:

Praca w projekcie skupionym na budowie ekosystemu danych w chmurze, z zespołem w modelu hub & spoke.

See also