DevOps / MLOps Engineer
Opis stanowiska
Dołączysz do organizacji, w której zespoły Data Science i AI budują rozwiązania oparte o modele ML i LLM — od klasycznych pipeline'ów predykcyjnych po systemy agentowe. Twoją rolą będzie zapewnienie im solidnego fundamentu inżynierskiego: infrastruktury, automatyzacji i standardów, dzięki którym modele i aplikacje AI trafiają na produkcję szybko, powtarzalnie i bezpiecznie.
To rola na styku DevOps i MLOps, z dużą samodzielnością i realnym wpływem na architekturę. Będziesz właścicielem infrastruktury jako kodu, pipeline'ów CI/CD, obrazów kontenerowych i decyzji architektonicznych. Zamiast gasić pożary — będziesz projektować platformę tak, żeby pożarów było jak najmniej: przez automatyzację, standaryzację wdrożeń, monitoring i hardening środowisk.
Jeśli lubisz pracować blisko zespołów data science, tłumaczyć potrzeby ML na architekturę infrastruktury i podnosić dojrzałość operacyjną organizacji — ta rola jest dla Ciebie.
Zakres obowiązków
Projektowanie, wdrażanie i utrzymanie infrastruktury dla workloadów DS/AI (trening, serwowanie modeli, aplikacje LLM, przetwarzanie danych)
Budowa i rozwój pipeline'ów CI/CD (GitHub Actions) dla aplikacji i modeli — od buildu obrazów, przez testy, po automatyczne wdrożenia
Utrzymanie i rozwój kodu infrastruktury (Terraform), chartów Helm i manifestów Kubernetes
Standaryzacja i automatyzacja procesu wdrażania modeli i usług AI na produkcję (konteneryzacja, wersjonowanie, rollback)
Zapewnienie niezawodności i skalowalności środowisk: autoskalowanie, HA, zarządzanie zasobami (w tym GPU), optymalizacja kosztów
Bezpieczeństwo platformy: RBAC, Network Policies, zarządzanie sekretami i certyfikatami, tożsamość, izolacja środowisk
Wdrażanie i rozwój observability (OpenTelemetry, Prometheus, Grafana): metryki, logi, tracing, alerting — także dla usług ML
Wsparcie zespołów DS/AI w codziennej pracy: debugowanie, code review infrastruktury, dobre praktyki, dokumentacja
Współudział w decyzjach architektonicznych dotyczących platformy danych i AI w organizacji
Wymagania
Min. 5 lat doświadczenia w obszarze DevOps / platform engineering / SRE
Produkcyjne doświadczenie z Kubernetes: Deployments, Services, HPA, RBAC, ConfigMaps/Secrets, CRDs, Network Policies, operatory
Infrastructure as Code: Terraform (preferowany) lub równoważne narzędzie; Helm dla workloadów klastrowych
Doświadczenie z CI/CD (GitHub Actions lub podobne)
Produkcyjne doświadczenie z co najmniej jedną chmurą publiczną (AWS / GCP / Azure): IAM, networking, usługi kontenerowe, managed databases
Programowanie w Pythonie na poziomie pozwalającym na budowę narzędzi, automatyzacji i współpracę z kodem zespołów DS
Doświadczenie z observability: OpenTelemetry / Prometheus / Grafana
Sprawne debugowanie i operacje produkcyjne (kubectl, eventy, logi)
Podstawy zarządzania danymi i projektowania pod stabilne, skalowalne workloady
Umiejętność współpracy z zespołami nietechnicznymi po stronie infrastruktury (DS/analitycy) i tłumaczenia ich potrzeb na rozwiązania
Mile widziane
Doświadczenie MLOps: MLflow, model registry, feature store, serwowanie modeli (KServe, Seldon, vLLM, Triton), orkiestracja pipeline'ów ML (Airflow, Kubeflow, Prefect)
Doświadczenie z infrastrukturą dla LLM: GPU scheduling, inference serving, zarządzanie kosztami API
GitOps w praktyce: Argo CD lub Flux
Architektury multi-tenant i izolacja środowisk dla wielu zespołów
Service mesh / izolacja sieciowa (Istio, traffic policies)
Zasady supply-chain security (podpisywanie obrazów, SBOM, skanowanie zależności)
Crossplane / KubeVela
Znajomość ekosystemu danych (Spark, Delta Lake, platformy typu Databricks / Microsoft Fabric)
Oferujemy:
Roczny budżet na kursy i szkolenia.
Elastyczne środowisko pracy - 100% zdalnie.
Dofinansowanie do karty Multisport.
Solidne wsparcie merytoryczne i praktyczne – jesteśmy oddani ciągłemu uczeniu się.
Pracę w szybko rozwijającej się branży związanej z AI, ML i Data Science.