Senior Data Engineer – GCP / BigQuery / Data Lakehouse
Summary
Senior Data Engineer builds and maintains GCP-based data pipelines, BigQuery lakehouse layers, and dbt/Airflow workflows for a large Polish bank’s data platform.
O Grupie Astek
Założona w 1988 roku we Francji Grupa Astek jest światowym partnerem w obszarze doradztwa inżynieryjnego oraz IT. Dzięki swojej wiedzy specjalistycznej w wielu sektorach przemysłowych i technologicznych, Astek wspiera międzynarodowych Klientów w rozwijaniu i wdrażaniu produktów oraz usług, jednocześnie uczestnicząc w ich transformacji cyfrowej.
Grupa Astek od momentu powstania opiera swój rozwój na kulturze przedsiębiorczości i innowacyjności oraz na budowaniu umiejętności swoich ponad 10 000 pracowników, którzy codziennie uczestniczą w zróżnicowanych projektach technologicznych i inżynieryjnych.
Zapraszamy na po więcej szczegółów.
Dla naszego klienta poszukujemy: Senior Data Engineer – GCP / BigQuery / Data Lakehouse
Dołącz do budowy nowego ekosystemu danych w jednym z największych banków w Polsce.
W ramach strategicznego programu „Data-Driven Bank” wdrażamy nowoczesną platformę danych opartą na Google Cloud Platform (GCP) oraz budujemy rozwiązanie klasy Data Lakehouse, integrujące raportowanie, analitykę i zarządzanie danymi.
Pracujemy w modelu hub & spoke, łącząc kompetencje biznesowe i technologiczne. Rozwijamy obszar Data Governance i tworzymy fundamenty pod rozwiązania AI oraz produkty danych nowej generacji.
Szukamy doświadczonego Senior Data Engineera, który chce mieć realny wpływ na architekturę, standardy techniczne i rozwój całej platformy danych.
Twoje codzienne obowiązki obejmują:
· Budowa i utrzymanie produkcyjnych pipeline’ów danych z wykorzystaniem dbt oraz Apache Airflow.
· Rozwój komponentów przetwarzania danych w Pythonie i PySpark.
· Projektowanie i rozwój warstw Gold i Platinum platformy lakehouse w BigQuery, zgodnie z architekturą medallion.
· Projektowanie rozwiązań end-to-end oraz podejmowanie i uzasadnianie decyzji architektonicznych.
· Optymalizacja wydajności i kosztów BigQuery, w tym partycjonowanie, klastrowanie oraz działania z obszaru FinOps.
· Budowa i utrzymanie procesów CI/CD z wykorzystaniem GitHub Actions.
· Rozwój infrastruktury jako kodu (Terraform) dla środowiska GCP.
· Implementacja i rozwój modelu bezpieczeństwa danych: IAM, RBAC/ABAC, policy tags, DLP.
· Współtworzenie standardów Data Governance, w tym zarządzania metadanymi i data lineage.
· Udział w code review oraz kształtowanie standardów i dobrych praktyk pracy zespołu.
· Współpraca z analitykami, data scientistami oraz stakeholderami biznesowymi.
· Konsultacje techniczne dla zespołów domenowych działających w modelu hub & spoke.
· Promowanie dobrych praktyk inżynierii danych i rozwiązań cloud-native w środowisku GCP.
Czego od Ciebie oczekujemy:
· Minimum 5 lat komercyjnego doświadczenia w inżynierii danych, w tym minimum 2 lata pracy przy projektach opartych o Google Cloud Platform.
· Doświadczenie w projektowaniu i wdrażaniu hurtowni danych / Data Lakehouse w dużych, produkcyjnych środowiskach.
· Umiejętność projektowania rozwiązań end-to-end i świadomego podejmowania decyzji architektonicznych.
· Bardzo dobra komunikacja i umiejętność współpracy z zespołami technicznymi oraz biznesowymi.
Technologie i kompetencje wymagane
· SQL – poziom zaawansowany: złożone zapytania analityczne, window functions, CTE, optymalizacja zapytań i modelowanie danych.
· Python – poziom zaawansowany: programowanie obiektowe, tworzenie produkcyjnych modułów, testy jednostkowe oraz biblioteki do przetwarzania danych, . pandas i NumPy.
· Google Cloud Platform: praktyczna znajomość ekosystemu GCP, w szczególności IAM, Cloud Storage, Secret Manager oraz Cloud Logging/Monitoring.
· BigQuery: projektowanie schematów, partycjonowanie i klastrowanie tabel oraz optymalizacja kosztów i wydajności zapytań.
· dbt (Core lub Cloud): modele, makra, testy, snapshoty i dokumentacja.
· Apache Airflow: projektowanie produkcyjnych DAG-ów oraz orkiestracja pipeline’ów dbt i zadań GCP.
· Apache Spark: tworzenie zadań PySpark i optymalizacja jobów.
· CI/CD: GitHub Actions, automatyzacja testów i deploymentu pipeline’ów danych.
· Git: biegłość w pracy z branchami, pull requestami, code review i git flow.
Mile widziane
· Terraform – moduły, workspaces i zarządzanie state dla GCP.
· Data Governance / Knowledge Catalog – Dataplex, Data Catalog, metadane, data lineage oraz klasyfikacja danych wrażliwych (DLP).
· Docker – konteneryzacja aplikacji i tworzenie customowych obrazów.
· Doświadczenie w obszarze FinOps i optymalizacji kosztów GCP.
· Praktyczne doświadczenie z architekturą medallion lub data mesh.
· Doświadczenie w sektorze finansowym lub bankowym.
· Certyfikaty GCP, w szczególności Professional Data Engineer lub Professional Cloud Architect.
Co zyskujesz?
· Długoterminowa współpraca
· Możliwość wyboru preferowanego rodzaju współpracy (regularna umowa o pracę ze wszystkimi korzyściami lub elastyczny kontrakt B2B)
· Szkolenia techniczne, certyfikaty i podnoszenie kwalifikacji
· Mentoring Competence Center - będziesz członkiem społeczności CC od pierwszego dnia pracy. Będziesz miał szansę rozwijać swoje umiejętności, uczestniczyć w różnych konferencjach oraz dzielić się wiedzą i doświadczeniem z ludźmi, którzy na co dzień mierzą się z tymi samymi wyzwaniami
· Jasna ścieżka kariery
· Pakiet benefitów pracowniczych
· Przyjazną atmosferę pracy, imprezy integracyjne i spotkania team-buildingowe
Potrzebujesz więcej informacji? Skontaktuj się ze mną: agnieszka.lech@astek.net
AO239601