Líder de Observabilidad y SER
Summary
Leads the observability and Site Reliability Engineering (SRE) strategy for critical digital services, defining monitoring standards, SLIs/SLOs, and incident response practices using tools like Dynatrace, Datadog, and Prometheus.
¡Sé parte de Stefanini!
En Stefanini somos más de 30.000 genios, conectados desde 41 países, haciendo lo que les apasiona y co-creando un futuro mejor.
Estrategia de observabilidad
- Definir la estrategia corporativa de Observabilidad.
- Diseñar y mantener el modelo de observabilidad tecnológica.
- Establecer estándares para la gestión de:
- Métricas.
- Registros.
- Trazas.
- Eventos.
- Alertas.
- Definir lineamientos para la instrumentación de aplicaciones y plataformas.
- Asegurar la visibilidad de servicios críticos, aplicaciones, APIs, infraestructura y componentes Cloud.
- Establecer criterios de monitoreo para ambientes productivos y no productivos.
- Promover una visión integral de observabilidad desde la experiencia del usuario hasta la infraestructura.
SRE y confiabilidad
- Definir y gobernar prácticas de Ingeniería de Confiabilidad del Sitio.
- Establecer SLI, SLO y Presupuestos de Error.
- Definir objetivos de disponibilidad, rendimiento y confiabilidad.
- Liderar la identificación y reducción de riesgos operativos.
- Promover la automatización de tareas repetitivas y manuales.
- Diseñar prácticas para mejorar la resiliencia de las aplicaciones.
- Gestionar la capacidad, disponibilidad y rendimiento de los servicios.
- Definir estándares para la operación de aplicaciones críticas.
- Trabaje con los equipos de desarrollo para incorporar confiabilidad desde el diseño.
- Impulsar la adopción de principios de ingeniería de confiabilidad en la organización.
Gestión de incidentes y problemas
- Liderar la gestión técnica de incidentes críticos.
- Coordinar la atención de incidentes de alto impacto.
- Participar en el Manejo de Incidentes.
- Liderar análisis de causa raíz —Root Cause Analysis—.
- Gestionar postmortems sin enfoque punitivo.
- Liderar el Manejo de Problemas Técnico.
- Identificar problemas recurrentes y definir planes de eliminación.
- Dar seguimiento a las acciones correctivas y preventivas.
- Evaluar tendencias de incidentes, degradaciones y fallas.
- Coordinador con Mesa de Ayuda, Operaciones, Desarrollo, Infraestructura, Cloud y proveedores.
- Participar en el Emergency Change Gate.
- Asegurar la documentación y trazabilidad de los incidentes relevantes.
Monitoreo y gestion de alertas
- Diseñar y gobernar tableros operativos y ejecutivos.
- Definir alertas inteligentes y accionables.
- Reduzca el ruido y la duplicidad de alertas.
- Establecer niveles de criticidad y prioridades.
- Definir procedimientos de respuesta ante eventos.
- Monitorear disponibilidad, latencia, errores, capacidad y rendimiento.
- Implementar prácticas de monitoreo proactivo.
- Promover el uso de automatización para detección y resolución.
- Asegurar que las alertas estén vinculadas con procedimientos operativos claros.
Plataformas y herramientas
- Liderar la evolución de las plataformas de observabilidad.
- Definir estándares de uso para Dynatrace, Datadog, Grafana y Prometheus.
- Promover la adopción de OpenTelemetry.
- Establecer criterios de gestión de logs mediante ELK, Splunk, Azure Monitor y Azure Log Analytics.
- Integrar herramientas de observabilidad con plataformas Cloud, Kubernetes y DevOps.
- Coordinador de instrumentación de aplicaciones y servicios.
- Definir la estrategia de almacenamiento, retención y consulta de registros.
- Evaluar nuevas herramientas y tecnologías de monitoreo.
- Asegurar la interoperabilidad entre las diferentes herramientas de observabilidad.
Liderazgo y mejora continua
- Liderar el equipo de Observabilidad y SRE.
- Definir objetivos, prioridades y planes de trabajo del equipo.
- Desarrollar capacidades técnicas y metodológicas.
- Impulsar una cultura DevOps y SRE.
- Promover la colaboración entre desarrollo, operaciones y soporte.
- Establecer prácticas de mejora continua.
- Presentar resultados, riesgos y oportunidades a la dirección.
- Definir planos para mejorar la madurez de observabilidad y confiabilidad.
- Identificar oportunidades de automatización y reducción de esfuerzo operativo.
Experiencia general
- Más de 7 años de experiencia profesional en tecnología, operaciones, infraestructura, Cloud, DevOps, observabilidad o confiabilidad.
- Experiencia en ambientes de alta criticidad y alta disponibilidad.
Experiencia específica
- Más de 3 años liderando equipos o iniciativas SRE.
- Experiencia comprobada en:
- Alta disponibilidad.
- Gestión de incidentes.
- Gestión de problemas.
- Análisis de la causa raíz.
- Observabilidad.
- Monitoreo de aplicaciones y plataformas.
- DevOps.
- Nube.
- Gestión de capacidad.
- Gestión de rendimiento.
- Automatización operativa.
- Definición de SLI, SLO y Presupuesto de errores.
- Gestión de postmortems.
- Diseño de tableros y métricas operativas.
- Gestión de incidentes críticos.
- Experiencia liderando equipos multidisciplinarios.
- Experiencia coordinando con desarrollo, infraestructura, soporte, seguridad, Cloud y proveedores.
- Experiencia en organizaciones de banca, fintech, telecomunicaciones o sectores con servicios digitales críticos, preferentemente.
Competencias y habilidades blandas
- Liderazgo técnico.
- Capacidad de resolución de problemas.
- Pensamiento analítico.
- Automatización.
- Mejora continúa.
- Influencia transversal.
- Comunicación efectiva.
- Capacidad para trabajar bajo presión.
- Toma de decisiones en situaciones críticas.
- Orientación a resultados.
- Capacidad de priorización.
- Liderazgo de equipos técnicos.
- Capacidad de negociación.
- Comunicación con áreas técnicas y ejecutivas.
- Orientación a la prevención.
- Cultura de aprendizaje a partir de incidentes.
Indicadores de éxito del puesto
- Disponibilidad de las aplicaciones y servicios críticos.
- Cumplimiento de los SLO definidos.
- Reducción del número de incidentes críticos.
- Reducción del tiempo medio de detección —MTTD—.
- Reducción del tiempo medio de recuperación —MTTR—.
- Reducción del número de incidentes recurrentes.
- Porcentaje de servicios con SLI y SLO definidos.
- Porcentaje de servicios con monitoreo completo de métricas, logs y trazas.
- Cumplimiento de Presupuestos Error.
- Reducción del ruido y falsas alertas.
- Porcentaje de autopsias ejecutadas en el tiempo.
- Cumplimiento de acciones correctivas derivadas de RCA.
- Nivel de automatización de tareas operativas.
- Reducción de intervenciones manuales.
- Porcentaje de aplicaciones críticas instrumentadas.
- Cobertura de observabilidad en ambientes productivos.
- Cumplimiento de los objetivos de capacidad y rendimiento.
- Nivel de madurez de las prácticas SRE y DevOps.
Entregables principales
- Estrategia corporativa de Observabilidad.
- Modelo operativo de SRE.
- Catálogo de servicios críticos.
- Estándares de métricas, logs y trazas.
- Catálogo de SLI y SLO.
- Definición de Error Budgets.
- Cuadros de mando operativos y ejecutivos.
- Matriz de criticidad de servicios.
- Modelo de alertamiento.
- Procedimientos de respuesta ante incidentes.
- Informes de disponibilidad y confiabilidad.
- Análisis de capacidad y rendimiento.
- Informes de incidentes críticos.
- Análisis de causa raíz.
- Post mortems y planos de acción.
- Informes de Gestión de Problemas.
- Hoja de ruta de automatización.
- Plan de evolución de la plataforma de observabilidad.
- Indicadores de madurez SRE y DevOps.
Competencias y habilidades blandas
- Liderazgo técnico.
- Capacidad de resolución de problemas.
- Pensamiento analítico.
- Automatización.
- Mejora continúa.
- Influencia transversal.
- Comunicación efectiva.
- Capacidad para trabajar bajo presión.
- Toma de decisiones en situaciones críticas.
- Orientación a resultados.
- Capacidad de priorización.
- Liderazgo de equipos técnicos.
- Capacidad de negociación.
- Comunicación con áreas técnicas y ejecutivas.
- Orientación a la prevención.
- Cultura de aprendizaje a partir de incidentes.