Azure SRE: Real-Time Data, AKS & Kafka Reliability
Agap2 Italia cerca un Site Reliability Engineer per potenziare l’infrastruttura cloud in produzione su Azure. Lavoro su AKS, PostgreSQL su Azure e MongoDB Atlas in un contesto internazionale, con attenzione a resilienza, sicurezza e scalabilità.
Il candidato partecipa a turni on‑call remunerati, collabora con i team di Platform e Product e contribuisce a pipeline di monitoraggio e automazione (Python, Bash, Terraform). Richiesta esperienza su Linux e Kubernetes, inglese fluente.
Migliorare resilienza e ottimizzare il cluster Kubernetes (AKS su Azure). Configuare e ottimizzare database relazionali/non relazionali (PostgreSQL su Azure, MongoDB Atlas). Gestire e ottimizzare Apache Kafka su AKS per dati in tempo reale. Automatizzare processi operativi per ridurre il toil e migliorare efficacia dei team. Partecipare alla turnazione on-call remunerata. Sviluppare pipeline di monitoraggio e alerting. Identificare root cause e sviluppare automazioni per prevenire problemi ricorrenti. Collaborare con lo sviluppo per migliorare SDLC e pratiche DevOps. Laurea in Informatica o equivalente. 3+ anni di esperienza con infrastrutture Cloud, preferibilmente Azure. Esperienza con sistemi distribuiti, alta scalabilità e resilienza per applicazioni cloud-native. Ambiente Linux, gestione e debugging di networking (DNS, Load Balancer, firewall e VPN). Esperienza con Docker, Kubernetes ed Helm. Esperienza con strumenti di monitoraggio e logging (Prometheus, Grafana, Azure Monitor). Competenze in automazione (Python, Bash, Terraform) e IaC. Familiarità con SRE, SLO, SLA ed error budgets. Disponibilità a turnazione on-call e disponibilità a lavorare in contesti internazionali. Buona conoscenza della lingua inglese, scritta e parlata. Remote friendly