Point your AI agent at freehire and let it find you a job.

Get the CLI →

TalyCap Global

NewBe an early applicant

Líder de Site Reliability Engineering (SRE)

Posted
Discussion

Summary

SRE Lead in Bogotá (hybrid, full-time) who drives the shift to a proactive Site Reliability Engineering model for mission-critical enterprise platforms: defining reliability standards, SLIs/SLOs, end-to-end observability, automation and self-healing, and leading SRE/DevOps teams. Core stack spans AWS/Azure hybrid multi-cloud, Terraform/Ansible IaC, ITIL v4 and SAP (S/4HANA, BTP).

🧠 ¡Buscamos Líder de Site Reliability Engineering (SRE)! 🧠

¿Te apasiona transformar operaciones tecnológicas tradicionales en ecosistemas resilientes, automatizados y observables, liderando equipos de alto desempeño que garanticen disponibilidad, rendimiento y continuidad de plataformas críticas de negocio?

🎯 Objetivo del rol:

Serás responsable de liderar la evolución de la operación tecnológica hacia un modelo proactivo basado en principios de Site Reliability Engineering (SRE), observabilidad avanzada y automatización. Tendrás un rol estratégico en la definición de estándares de confiabilidad, resiliencia y rendimiento sobre plataformas empresariales de misión crítica. Además, dirigirás iniciativas de reducción de deuda técnica, adopción de capacidades de autocuración (Self-Healing) y fortalecimiento de la continuidad operativa en entornos híbridos.

🎓 Requisitos del perfil

  • Formación académica: Profesional universitario en Ingeniería de Sistemas, Ingeniería de Software, Ingeniería Electrónica o carreras afines de base tecnológica.

  • Experiencia: Mínimo 5 a 6 años de experiencia en infraestructura tecnológica, operaciones TI o arquitectura de software, con al menos 2 años liderando equipos de SRE, DevOps o Ingeniería de Rendimiento.

Conocimientos obligatorios:

• ☁️ Cloud: AWS, Azure, ecosistemas híbridos On-Premise y Multi-Cloud

• ⚙️ DevOps y CI/CD: Terraform, Ansible, Infrastructure as Code (IaC), automatización de infraestructura

• 🏛️ Arquitectura: Resiliencia tecnológica, escalabilidad, transición arquitectónica, reducción de deuda técnica, Clean Core

• 🧭 Liderazgo y Metodologías: Site Reliability Engineering (SRE), DevOps, ITIL v4, gestión de SLI/SLO, Blameless Post-Mortems, gestión de incidentes mayores

• 🔗 ERP / SAP: Arquitectura de ecosistemas SAP de misión crítica, S/4HANA, EWM, IBP, BTP, metodologías de despliegue SAP

• 🔧 Otros: Observabilidad end-to-end, telemetría avanzada, monitoreo distribuido, ingeniería de rendimiento, pruebas de carga, pruebas de estrés, Chaos Engineering

Conocimientos deseables:

• 🔧 Otros: Certificación en SRE, certificaciones en herramientas de observabilidad, certificaciones en arquitectura Cloud o metodologías SAP

💡 Competencias personales

  • Liderazgo estratégico de equipos multidisciplinarios.

  • Pensamiento analítico orientado a la confiabilidad operativa.

  • Capacidad de toma de decisiones bajo escenarios críticos.

  • Comunicación efectiva con áreas técnicas y de negocio.

  • Orientación a la mejora continua y la innovación tecnológica.

⚙️ Responsabilidades principales

  • Liderar la estrategia global de resiliencia, confiabilidad y escalabilidad tecnológica.

  • Diseñar e implementar capacidades de observabilidad de extremo a extremo sobre plataformas empresariales críticas.

  • Definir métricas, indicadores y objetivos de nivel de servicio alineados con el negocio.

  • Dirigir iniciativas de automatización y autocuración para reducir la intervención manual en incidentes repetitivos.

  • Supervisar pruebas de carga, estrés y simulaciones de fallas para validar la estabilidad de los servicios.

  • Liderar análisis de causa raíz bajo enfoques Blameless, promoviendo la mejora continua.

  • Gestionar programas de reducción de deuda técnica y fortalecimiento arquitectónico.

  • Asegurar la disponibilidad operativa durante procesos de transformación tecnológica y modernización de plataformas.

  • Coordinar y desarrollar equipos especializados en SRE, DevOps y rendimiento.

  • Presentar riesgos, planes de remediación y estrategias de continuidad operativa a la dirección tecnológica.

🕒 Condiciones laborales

  • 📍 Ubicación: Hibrido

  • 🧩 Tipo de contrato: Nomina

  • Horario: Tiempo completo

  • 💰 Salario: A convenir

🌐 TALYCAP GLOBAL – Conectamos el mejor talento IT con proyectos de alto impacto.

#LiderSRE #SiteReliabilityEngineering #Observabilidad #TalycapGlobal

Skills

See also

SRE jobs by country — openings, pay and top skills →

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available