Site Reliability Engineer (SRE)
Summary
On-site Site Reliability Engineer at Chile's Digital Government Secretariat in downtown Santiago, responsible for SLOs/error budgets, observability, infrastructure-as-code, CI/CD pipelines, incident management and on-call for critical public-sector platforms. Stack centers on Linux, AWS (or Azure/GCP), Docker/Kubernetes, Terraform, Prometheus/Grafana and GitLab CI.
- Medir y mantener SLOs, SLIs y error budgets de los servicios críticos de la SGD, y usarlos para decidir cuándo se despliega y cuándo se frena.
- Diseñar y operar la observabilidad de las plataformas — métricas, logs y trazas — con dashboards y alertas orientadas a síntomas, no a ruido.
- Automatizar aprovisionamiento, despliegue y operación de la infraestructura con Infraestructura como Código.
- Participar en el ciclo completo de gestión de incidentes: detección, mitigación, comunicación, turnos on-call y postmortems sin culpa.
- Identificar y eliminar el toil: todo trabajo manual repetitivo que hoy consume tiempo y mañana debería ser código.
- Trabajar con los equipos de desarrollo para que los servicios nazcan confiables, escalables y operables, incluyendo production readiness reviews antes de que algo llegue a producción.
- Gestionar capacidad y rendimiento: anticipar la demanda, optimizar recursos y controlar costos.
- Implementar y asegurar alta disponibilidad, recuperación ante desastres, respaldos y continuidad operativa.
- Fortalecer la seguridad operacional.
- Mantener y mejorar los pipelines de CI/CD.
- Documentar arquitecturas, runbooks y estándares técnicos.
- Linux en ambientes productivos.
- Cloud pública, preferentemente AWS (también consideramos Azure o GCP).
- Contenedores y orquestación: Docker y Kubernetes o equivalentes.
- Infraestructura como Código: Terraform, Ansible, CloudFormation o equivalentes.
- Observabilidad y logs: Prometheus, Grafana, ELK/OpenSearch, CloudWatch, Datadog, New Relic o equivalentes.
- CI/CD: GitLab CI/CD, GitHub Actions, Jenkins, Argo CD, Azure DevOps o equivalentes.
- Programación y scripting: como Python, Java, Go, Bash, PowerShell.
- Gestión de incidentes en alta disponibilidad: diagnóstico de fallas, análisis de causa técnica y recuperación de servicios.
- Práctica real de SRE: confiabilidad, observabilidad, automatización y mejora continua como forma de trabajo.
Requisito formal del cargo público: título profesional de una carrera de ingeniería en computación, informática, telecomunicaciones, electrónica o afín, de al menos 8 semestres de duración.
Renta. $3.739.815 bruto mensualizado (grado 9º E.U.S.). El monto varía mes a mes: en marzo, abril, junio, septiembre y diciembre se suman bonos sujetos al cumplimiento de metas anuales, y el resto del año se paga la renta base. El grado y la renta son referenciales, a confirmar por la Subsecretaría de Hacienda según disponibilidad presupuestaria.
Condiciones.
- Calidad jurídica Contrata. El primer contrato tiene una duración fija de 3 meses, al término de los cuales se evalúa la continuidad. Los empleos a contrata duran hasta el 31 de diciembre de cada año, renovables por prórroga (art. 10 D.F.L. N° 29 de 2005).
- 44 horas semanales, lunes a viernes, presencial en Teatinos 92, piso 9, Santiago centro.
Beneficios.
- Permisos administrativos.
- Sala cuna.
- Capacitación y desarrollo profesional.
- Programa de bienestar.
- Oficina a pasos del metro, en pleno centro de Santiago.