Senior Data Engineer / Data Scientist
Summary
Build and maintain large-scale data pipelines, identity graphs, and ML models for programmatic advertising, processing tens of millions of device signals daily.
O nas
JustTag Group to polska firma technologiczna z obszaru data i AdTech (~50 osób), z biurem w Warszawie. Budujemy własne aktywa danowe: graf tożsamości JustID, technologię lokalizacyjną KoalaMetrics, kontekstowy silnik klasyfikacji CoCa oraz produkty pomiarowe klasy retail media (Drive2Store / Drive2Purchase). Pracujemy dla największych marek i agencji w Europie.
Mamy własny graf tożsamości, technologię lokalizacyjną i lata sygnałów z dziesiątek milionów urządzeń. To produkcja, która żyje i rośnie – nie środowisko do budowania demo.
O roli
Szukamy kogoś z autentyczną ciekawością danych, kto wejdzie w ten system, będzie zadawał pytania i drążył głębiej niż zadanie. Interesuje nas osoba, która czyta cudzy kod i ma oko na to co można ulepszyć.
Jeżeli sprawnie poruszasz się na stykach – między danymi, produktem i biznesem – i potrafisz przełożyć to, co widzisz w modelu, na język decyzji, napisz do nas. W praktyce oznacza to codzienną pracę na danych, które mają realną wartość rynkową i realnych odbiorców.
To pozycja hybrydowa – łączy inżynierię danych, applied ML i integracje z platformami programmatycznymi.
Czym będziesz się zajmować?
Rozwijaniem produkcyjnych pipeline'ów przetwarzania danych dużej skali (Python, Spark, przetwarzanie wsadowe i rozproszone);
Pracą z grafem tożsamości: łączenie i deduplikacja identyfikatorów (cookie, GAID, cross-device), utrzymaniem jakości i skali grafu;
Przetwarzaniem danych lokalizacyjnych: sygnały WiFi, poligony, catchment area, footfall, analizy geoprzestrzenne;
Budowaniem i ewaluacją modeli: look-alike, scoring, segmentacją, oceną jakości segmentów;
Automatyzacją raportów pomiarowych (lift, incrementality, atrybucja kampanii) i współpracą z zespołem analitycznym;
Integracją z platformami programmatic (DV360, Adform, Google Ad Manager / DDP);
Dokumentowaniem rozwiązań i wprowadzaniem standardów pracy – tak, żeby wiedza zostawała w zespole.
Czego potrzebujemy?
Min. 5 lat w inżynierii danych lub data science w środowisku produkcyjnym;
Python;
SQL zaawansowany, PostgreSQL - złożone zapytania, optymalizacja, praca na dużych tabelach;
Spark - rozproszone przetwarzanie dużych wolumenów;
dbt - transformacje, testy, dokumentacja modeli;
Orkiestracja i utrzymanie pipeline'ów danych;
Modelowanie i ML stosowane - scoring, klasyfikacja, look-alike, miary podobieństwa, ocena jakości modeli;
Samodzielność i umiejętność pracy w zmiennym środowisku.
Co będzie dodatkowym atutem?
Delta Lake / HDFS lub podobna warstwa storage;
Statystyka i modelowanie probabilistyczne - grupy kontrolne, testy, atrybucja;
Docker / Kubernetes;
FastAPI / Streamlit;
Doświadczenie w adtech / martech - programmatic, DMP, retail media;
Identity resolution - cookie, GAID, cross-device;
Dane lokalizacyjne, geospatial, indeksy heksagonalne;
Taksonomia IAB, cookieless / post-ATT, clean roomy.
Co oferujemy?
Pracę na unikalnych, własnych aktywach danowych o realnej skali rynkowej;
Bezpośredni wpływ na rdzeń produktowy – nie wdrożenia narzędzi, ale ewolucja tego, co już działa;
Elastyczny model pracy: hybrydowo z Warszawy;
Forma zatrudnienia do wyboru: UoP lub B2B.