Remote-Friendly Site Reliability Engineer on Azure
Posted Updated
Agap2 Italia cerca un Site Reliability Engineer per contribuire alla scalabilità e all’ottimizzazione di un’infrastruttura Cloud in produzione su Azure. Il candidato lavorerà su un sistema distribuito in tempo reale, includendo edge e gestione di eventuali scenari offline, con attività in lingua inglese per contatti internazionali.
La missione include garantire affidabilità, sicurezza e resilienza, partecipare a turni on-call remunerati, e crescere tramite training on the job.
Migliorare resilienza e scalabilità del cluster Kubernetes su AKS, garantendo alte performance e sicurezza. Ottimizzare database relazionali e non relazionali (PostgreSQL su Azure, MongoDB Atlas) per performance e affidabilità. Gestire e ottimizzare Apache Kafka su AKS per flussi dati in tempo reale. Automatizzare operazioni per ridurre toil e migliorare l’efficacia dei team. Partecipare alla turnazione on-call per incident management. Sviluppare pipeline di monitoraggio e alerting per problemi operativi. Individuare root cause e redigere documentazione tecnica ed automazioni. Collaborare con lo sviluppo per migliorare SDLC e pratiche DevOps/GitOps. Laurea in Informatica o equivalente. Esperienza 3+ anni in infrastrutture Cloud, preferibilmente Azure. Conoscenza di sistemi distribuiti, scalabilità e resilienza per cloud-native. Esperienza Linux, Networking (DNS, Load Balancer, firewall, VPN). Esperienza con Docker, Kubernetes ed Helm. Esperienza con strumenti di monitoraggio e logging (Prometheus, Grafana, Azure Monitor). Capacità di automazione (Python, Bash, Terraform) e IaC. Conoscenza SRE: SLO/SLA ed error budgets. Disponibilità a turni on-call.