MLOps Engineer (Azure & Databricks)
Summary
Build and maintain a production-grade ML platform on Azure Databricks: automate pipelines, CI/CD, model lifecycle, and observability for thousands of time-series forecasts in HVAC.
W Data by Example nie tylko dostarczamy rozwiązania IT – my nadajemy danym sens:
Aktualnie dla naszego klienta z branży HVAC budujemy zespół ekspertów do przebudowy wewnętrznie opracowanego oprogramowania do uczenia maszynowego, służącego do prognozowania kilku tysięcy szeregów czasowych w ramach każdego cyklu przetwarzania. Celem jest stworzenie rozwiązania klasy produkcyjnej, spełniającego wysokie standardy w zakresie łatwości utrzymania, elastyczności, skalowalności i doskonałości operacyjnej.
Główne zadania:
zbudowanie solidnych fundamentów inżynieryjnych
automatyzacja, zapewnienie skalowalności i obserwowalności
wdrożenie procesów wydawniczych i zarządzania cyklem życia modeli ML, aby zagwarantować niezawodne i efektywne kosztowo wdrażanie oraz eksploatację zadań związanych z danymi i uczeniem maszynowym w środowisku Databricks
Oczekiwania:
min. 5-letnie komercyjne doświadczenie na takim samym lub podobnym stanowisku
-
ekspercka wiedza i doświadczenie w pracy z platformą Databricks (Unity Catalog, obszary robocze, klastry, zadania/jobs, Databricks Asset Bundles / wdrożenia deklaratywne, separacja środowisk: dev, qa, prod)
• zaawansowane umiejętności programowania w języku Python z wykorzystaniem współbieżności i równoległego przetwarzania zadań w Databricks (szczególnie w środowisku Spark)
• automatyzacja procesów CI/CD z wykorzystaniem GitHub Actions, w tym budowanie, testowanie, wdrażanie oraz bramki jakościowe (release gates)
• optymalizacja wydajności i kosztów środowisk Spark/Databricks poprzez dostrajanie klastrów, równoległe przetwarzanie i profilowanie czasu wykonywania zadań
• wdrażanie mechanizmów monitorowania i obserwowalności (logi, metryki, alerty, pulpity nawigacyjne, procedury operacyjne/runbooki, monitorowanie jakości danych)
• zarządzanie wydaniami, wersjonowanie, nadzór nad procesem wdrażania oraz strategie wycofywania zmian (rollback)
• praktyczne wykorzystanie narzędzi programistycznych wspieranych przez sztuczną inteligencję (AI) w celu zwiększenia efektywności pracy inżynierskiej
• doświadczenie w pracy z MLflow na poziomie co najmniej średniozaawansowanym, obejmujące śledzenie eksperymentów, rejestr modeli oraz zarządzanie cyklem życia modelu