Data Engineer
Nasze wymagania:
- 6-10 lat doświadczenia w IT
- 4-5 lat praktycznego doświadczenia w pracy z PySpark i Python
- Bardzo dobra znajomość zasad data engineeringu oraz nowoczesnych architektur przetwarzania danych
- Udokumentowane doświadczenie w zakresie PySpark (Spark SQL, DataFrames, optymalizacja wydajności)
- Udokumentowane doświadczenie w programowaniu i tworzeniu aplikacji w Pythonie
- Udokumentowane doświadczenie w budowie i orkiestracji procesów w Azure Data Factory (ADF)
- Dobra znajomość technik optymalizacji danych: partycjonowanie, cache'owanie, optymalizacja joinów, optymalizacja zapytań
- Doświadczenie w pracy z rozproszonymi systemami przetwarzania dużych zbiorów danych
- Dobra znajomość SQL, baz danych oraz modelowania danych
- Bardzo dobre umiejętności analityczne i rozwiązywania problemów
Mile widziane:
- Praktyczne doświadczenie z Azure Databricks (ADB)
- Znajomość technologii chmurowych, preferencyjnie Microsoft Azure
- Doświadczenie z procesami CI/CD oraz praktykami DevOps w obszarze data engineering
- Znajomość architektur Data Lake oraz Lakehouse
- Wiedza z zakresu nowoczesnego zarządzania danymi (Data Governance) i monitoringu danych
Zakres obowiązków:
- Praca z biura 3 razy w tygodniu
- Projektowanie, rozwijanie i utrzymywanie skalowalnych potoków danych z wykorzystaniem PySpark i Python
- Budowanie i optymalizacja procesów ETL/ELT do przetwarzania dużych wolumenów danych
- Tworzenie wydajnego, wielokrotnego użytku kodu z naciskiem na optymalizację
- Przetwarzanie i zarządzanie danymi strukturalnymi oraz niestrukturalnymi pochodzącymi z różnych źródeł
- Wdrażanie najlepszych praktyk związanych z data engineeringiem, optymalizacją wydajności i jakością kodu
- Tworzenie, orkiestracja i monitorowanie procesów danych przy użyciu Azure Data Factory (ADF)
- Współpraca z Data Scientistami, Data Analystami, Architektami Rozwiązań oraz innymi interesariuszami
- Zapewnienie jakości, niezawodności i integralności danych na wszystkich platformach danych
- Identyfikowanie i rozwiązywanie problemów wydajnościowych w potokach przetwarzania danych
- Udział w dyskusjach dotyczących architektury danych oraz inicjatywach związanych z ciągłym doskonaleniem