Principal Databricks Architect
Dla klienta - wiodącej, globalnej platformy z branży FinTech/Crypto z siedzibą w USA – poszukujemy wyjątkowo doświadczonego eksperta Databricks/Spark, który podejmie się realizacji strategicznego projektu benchmarkowego o krytycznym znaczeniu biznesowym.
Klient analizuje migrację kluczowych workloadów z Databricks do Snowflake w celu optymalizacji całkowitego kosztu utrzymania (TCO). W ramach procesu decyzyjnego Snowflake przygotowuje oficjalny benchmark wydajnościowo-kosztowy. Poszukujemy osoby, która po stronie Databricks zaprojektuje, zbuduje od podstaw oraz zoptymalizuje rozwiązanie konkurencyjne, mające stanowić bezpośredni punkt odniesienia dla benchmarku Snowflake.
To projekt dla osób, które pracowały na prawdziwie dużej skali danych i potrafią maksymalizować wydajność przy jednoczesnej optymalizacji kosztów.
Projekt ma charakter krótkoterminowy (4–6 tygodni), bardzo intensywny i wysokopriorytetowy.
Informacje o współpracy
Model współpracy: B2B / kontrakt
Czas trwania projektu: 4–6 tygodni
Start: ASAP
Tryb pracy: Remote
Współpraca z zespołami w USA (EST/PST)
Wynagrodzenie: do ustalenia – poszukujemy unikalnych kompetencji eksperckich
Zakres odpowiedzialności
Zaprojektowanie i implementacja rozwiązania benchmarkowego w środowisku Databricks na AWS.
Budowa oraz optymalizacja pipeline'ów Big Data przetwarzających dane historyczne i strumieniowe.
Projektowanie architektury end-to-end: ingestion, processing, storage oraz monitoring kosztów.
Optymalizacja wydajności Apache Spark, Structured Streaming oraz Delta Lake.
Dobór optymalnej konfiguracji infrastruktury AWS i Databricks pod kątem TCO.
Analiza i raportowanie kosztów oraz wydajności rozwiązania Databricks w porównaniu do Snowflake.
Współpraca z zespołami technicznymi i biznesowymi klienta w USA.
Skala technicznego wyzwania
Dane historyczne: około 7,5 miliarda rekordów (initial load).
Dane przyrostowe: około 90 milionów zdarzeń na godzinę.
Źródło danych streamingowych: Apache Kafka.
Chmura: AWS.
Charakterystyka środowiska: Big Data, Near Real-Time Processing, High Throughput.
Kogo szukamy
Szukamy eksperta klasy Principal/Staff/Lead, który posiada udokumentowane doświadczenie w realizacji projektów Big Data o bardzo dużej skali.
Must-have
Wieloletnie doświadczenie eksperckie w pracy z Databricks oraz Apache Spark.
Bardzo dobra znajomość architektury Spark, optymalizacji zapytań, konfiguracji klastrów oraz optymalizacji kosztowej środowisk chmurowych.
Praktyczne doświadczenie z Structured Streaming / Spark Streaming przy przetwarzaniu milionów zdarzeń na minutę.
Bardzo dobra znajomość integracji Apache Kafka + Databricks/Spark na AWS.
Udokumentowane doświadczenie w benchmarkingu wydajnościowym i kosztowym (TCO).
-
Praktyczna znajomość:
AWS EC2 optimization,
Photon Engine,
autoscalingu,
Delta Lake tuning,
cost optimization / FinOps.
Dodatkowe kompetencje
Umiejętność całościowego spojrzenia na architekturę systemów danych.
Silne kompetencje analityczne i biznesowe.
Umiejętność przygotowania precyzyjnych analiz kosztowych i raportów porównawczych.
Bardzo dobra komunikacja biznesowa i techniczna.
Wymagania organizacyjne
Gotowość do współpracy z zespołami w USA (częściowa praca w godzinach popołudniowych/wieczornych czasu polskiego).
Umiejętność pracy pod presją czasu oraz realizacji krótkich, intensywnych projektów typu PoC/Benchmark.
Język angielski na poziomie minimum C1.
Kogo nie szukamy
Osób z doświadczeniem wyłącznie na małych i średnich wolumenach danych.
Inżynierów pracujących głównie przy klasycznych procesach batchowych bez doświadczenia w produkcyjnym streamingu na dużą skalę.
Kandydatów poszukujących standardowych, długoterminowych projektów realizowanych wyłącznie w godzinach 9:00–17:00 czasu polskiego.
Oferujemy
Udział w strategicznym projekcie o globalnej skali.
Możliwość bezpośredniego wpływu na decyzję technologiczną o wysokiej wartości biznesowej.
Współpracę z międzynarodowym zespołem ekspertów.
Elastyczny model współpracy (B2B).
-
Wynagrodzenie dostosowane do poziomu doświadczenia i unikalnych kompetencji kandydata.