freehire launches on Product Hunt on 26 August.

Follow →

Senior Site Reliability Engineer (Azure, Monitoring & Observability)

Summary

Senior SRE builds and runs Azure-based Monitoring & Observability and Data Quality platforms, setting up metrics, logs, traces, alerting, and automation to keep production environments reliable and cost-efficient.

W ITLT pomagamy naszym zaprzyjaźnionym firmom przekształcać ambitne pomysły w cyfrową rzeczywistość. Z nastawieniem na wyzwania, ciekawość technologii i zwinność współtworzymy wyjątkowe rozwiązania IT i zapewniamy doświadczone osoby eksperckie, które pomagają przyspieszać cyfrową transformację.

Aktualnie poszukujemy profilu na stanowisko: Senior Site Reliability Engineer (Azure, Monitoring & Observability)

Budujemy niewielki, 2–3-osobowy zespół odpowiedzialny za stworzenie i rozwój platformy Monitoring & Observability (M&O) oraz Data Quality dla całej organizacji.

Jako Senior Site Reliability Engineer będziesz odpowiadać za projektowanie, budowę i rozwój platformy M&O w środowisku Azure i data platform. Twoim zadaniem będzie rozwój monitoringu aplikacji, infrastruktury i danych, proaktywne wykrywanie problemów, alerting, analiza metryk, logów i trace’ów oraz automatyzacja procesów operacyjnych.

Informacje organizacyjne:

  • Tryb realizacji usług: 100% zdalnie

  • Start: ASAP

  • Forma współpracy: kontrakt b2b, zaangażowanie stabilne, długofalowe

  • Język angielski: wymagany na poziomie zaawansowanym (C1) - codzienna współpraca w międzynarodowym środowisku

  • Sektor: FMCG

Zakres zadań:

  • Projektowanie i rozwój platformy Monitoring & Observability dla środowiska Azure/data platform

  • Monitoring aplikacji, infrastruktury i Kubernetes/AKS oraz konfiguracja alertingu

  • Analiza metryk, logów i trace’ów, troubleshooting oraz root cause analysis

  • Budowanie mechanizmów proaktywnego wykrywania problemów i anomalii

  • Dbanie o reliability, availability, stability i performance środowisk produkcyjnych

  • Automatyzacja procesów operacyjnych oraz rozwój Infrastructure as Code i CI/CD

  • Udział w incident management oraz wdrażaniu praktyk Site Reliability Engineering

  • Optymalizacja wykorzystania zasobów i kosztów Azure (FinOps)

Oczekiwania:

  • Min. 5 lat doświadczenia w obszarze Site Reliability Engineering / DevOps / Cloud Engineering (w tym doświadczenie na stanowisku SRE)

  • Bardzo dobra znajomość Microsoft Azure oraz doświadczenie w pracy z infrastrukturą produkcyjną

  • Praktyczna znajomość Kubernetes, w szczególności Azure Kubernetes Service (AKS)

  • Doświadczenie z Kafka, w szczególności Kafka on AKS

  • Bardzo dobra znajomość narzędzi Monitoring & Observability, w szczególności Grafana Enterprise / Grafana Cloud, Prometheus, Loki i Thanos

  • Doświadczenie w pracy z metrics, logs & traces, tworzeniu dashboardów oraz konfiguracji alertingu

  • Dobra znajomość praktyk SRE, w tym incident management, troubleshooting, root cause analysis oraz performance monitoring i optimization

  • Doświadczenie z Infrastructure as Code, w szczególności Terraform

  • Praktyczna znajomość CI/CD, w szczególności GitHub Actions i/lub Azure DevOps / ADO Pipelines

  • Umiejętność automatyzacji z wykorzystaniem Python i Shell scripting

Mile widziane:

  • Znajomość Databricks

  • Doświadczenie z Azure SQL Server

  • Znajomość Fivetran

  • Znajomość Apache Flink

Oferujemy:

  • Długofalowa, stabilna współpraca w oparciu o kontrakt B2B

  • Szansa na rozwój w dużej strukturze, bezpośredni kontakt z Managerem zespołu

  • Współpraca z ekspertami w firmie, w której IT jest dojrzałe i globalne, a metodyki zwinne są respektowane

  • Dopłata do karty MultiSport oraz ubezpieczenia

  • Sprawny proces rekrutacyjny (wideokonferencja), maksymalnie 2 spotkania online (pierwsze z kimś z zespołu, drugie z Managerem)

Agencja zatrudnienia - nr certyfikatu 14181

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available