Point your AI agent at freehire and let it find you a job.

Get the CLI →

UPVANTA SPÓŁKA Z OGRANICZONĄ ODPOWIEDZIALNOŚCIĄ

NewBe an early applicant

Senior Data Engineer / Spark Developer (m/k/n)

Posted 1 view
Discussion

Summary

Senior data engineer designing and building data reconciliation and Data Lakehouse pipelines (Raw/Bronze/Silver/Gold) with Apache Spark (PySpark, Spark SQL), MongoDB and Apache Iceberg, plus CI/CD with Jenkins and monitoring via Prometheus/Grafana. Hybrid: 1-2 days/week from the Wrocław office; B2B paid per man-day.

Nasze wymagania

  • Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark.
  • Bardzo dobra znajomość PySpark, Spark SQL, DataFrame API oraz Structured Streaming.
  • Doświadczenie w integracji Apache Spark z MongoDB przy wykorzystaniu MongoDB Spark Connector.
  • Praktyczna znajomość Apache Iceberg oraz zarządzania wersjonowanymi tabelami danych.
  • Doświadczenie w budowie rozwiązań Data Lake lub Data Lakehouse.
  • Dobra znajomość języka Python.
  • Doświadczenie z Jenkins oraz budową pipeline'ów CI/CD.
  • Znajomość narzędzi monitoringu i observability, w szczególności Prometheus oraz Grafana.
  • Doświadczenie w pracy zgodnie z metodykami Agile (Scrum lub Kanban).
  • Praktyczna znajomość Jira i Confluence.
  • Gotowość do pracy z biura 1-2 dni w tygodniu (Wrocław)

Mile widziane

  • Doświadczenie z Delta Lake lub Apache Hudi.
  • Znajomość Kubernetes, Docker oraz Spark Operator.
  • Doświadczenie w pracy z rozwiązaniami OpenTelemetry lub Dynatrace.
  • Znajomość zagadnień Data Quality, Data Governance oraz Data Observability.
  • Doświadczenie w środowiskach chmurowych (Azure, AWS, GCP).

O projekcie

Do zespołu Data Platform poszukujemy doświadczonego Spark / Data Lakehouse Developera, który będzie odpowiedzialny za projektowanie i rozwój rozwiązań do przetwarzania, synchronizacji oraz rekoncyliacji danych w środowisku Big Data. Osoba na tym stanowisku będzie współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość, wydajność i niezawodność procesów danych.

Zakres obowiązków

  • Projektowanie i implementacja procesów rekoncyliacji danych w Apache Spark (PySpark, Spark SQL).
  • Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności.
  • Tworzenie i rozwój reguł jakości danych, wykrywanie braków, duplikatów oraz anomalii.
  • Budowa i utrzymanie warstw Data Lakehouse w modelu Raw / Bronze / Silver / Gold.
  • Praca z Apache Iceberg i zarządzanie wersjonowanymi zbiorami danych.
  • Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych.
  • Tworzenie i rozwijanie pipeline'ów CI/CD dla aplikacji Spark.
  • Implementacja monitoringu, metryk i alertowania dla procesów danych.
  • Automatyzacja wdrożeń z wykorzystaniem Docker, Kubernetes oraz Spark Operator.
  • Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych.
  • Tworzenie dokumentacji technicznej, diagramów architektury oraz runbooków.
  • Współpraca z Data Engineerami, DevOps Engineerami, Analitykami Biznesowymi i zespołami produktowymi.
  • Udział w code review oraz mentoring mniej doświadczonych członków zespołu.

Oferujemy

budżet: B2B, 1100-1300 zł/MD

Praca hybrydowa - Wrocław

Skills

See also

Data Engineering jobs by country — openings, pay and top skills →

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available