Data Engineer (DataBricks)
Summary
Build and migrate a financial-crime data layer for AML using PySpark and Databricks, centralizing feeds from batch and API sources into a gold-layer data warehouse.
W Scalo zajmujemy się dostarczaniem projektów software'owych i wspieraniem naszych partnerów w rozwijaniu ich biznesu. Tworzymy oprogramowanie, które umożliwia ludziom dokonywanie zmian, działanie w szybszym tempie oraz osiąganie lepszych rezultatów. Wykorzystujemy szerokie spektrum usług IT, aby wspierać naszych klientów w realizacji ich celów biznesowych.
Obszary naszej działalności obejmują m.in.:
• doradztwo technologiczne,
• tworzenie oprogramowania,
• systemy wbudowane,
• rozwiązania chmurowe,
• zarządzanie danymi,
• dedykowane zespoły projektowe.
Cześć! Poznaj możliwości współpracy ze Scalo!
Zakres współpracy obejmuje:
projekt realizowany w branży finansowej w obszarze AML,
współpracę w zespole analityczno-modelarskim z Data Analitykami oraz Developerami,
rozwój i migrację warstwy danych AML obejmującą centralizację danych z wielu źródeł,
migrację istniejących procesów ETL do nowego środowiska analitycznego,
dostosowanie architektury danych oraz procesów do środowiska opartego o Databricks,
projektowanie, modelowanie, rekomendowanie oraz implementację rozwiązań w PySpark z wykorzystaniem Databricks,
rozwój warstwy danych na poziomie gold w hurtowni danych,
integrację procesów z różnorodnymi źródłami danych, w tym API oraz źródłami wsadowymi,
wykorzystanie technologii Python, PySpark, SQL (Teradata) oraz Databricks,
świadczenie usług w modelu zdalnym z wizytami w biurze raz na kwartał w Warszawie, Wrocławiu lub Poznaniu,
stawka do 130 PLN/h + VAT w oparciu o współpracę B2B.
Kompetencje wymagane do realizacji usług:
wykształcenie wyższe STEM,
5–8 lat doświadczenia w realizacji projektów związanych z przetwarzaniem i analizą danych,
bardzo dobra znajomość Databricks, w tym umiejętność projektowania i implementacji rozwiązań, a nie wyłącznie korzystania z platformy od strony użytkownika,
praktyczne doświadczenie w wykorzystaniu PySpark,
doświadczenie w projektowaniu oraz migracji procesów ETL,
umiejętność modelowania oraz przetwarzania danych w środowiskach hurtowni danych,
doświadczenie w parsowaniu danych,
doświadczenie w integracji procesów ze źródłami danych opartymi o API oraz procesy batchowe,
bardzo dobra znajomość języka Python,
praktyczna znajomość SQL, w szczególności środowiska Teradata,
wysoko rozwinięte umiejętności analityczne,umiejętność współpracy w zespołach projektowych,
komunikatywność oraz otwartość na współpracę zespołową.
Co oferujemy w ramach współpracy?
możliwość świadczenia usług w różnorodnych projektach z obszaru Software, Embedded, Data i Cloud Services,
zaangażowanie w dodatkowe inicjatywy presealsowe oraz eksperckie,
dostęp do opieki medycznej, karty sportowej oraz platformy kafeteryjnej zgodnie z obowiązującymi zasadami współpracy.