Senior DevOps observability (SRE) engineer
Summary
Senior DevOps/SRE engineer builds and maintains observability, CI/CD, and Kubernetes infrastructure for a high-load product, using tools like OpenTelemetry, Grafana, and Argo CD.
Мы ищем Senior DevOps observability (SRE) engineer, который будет отвечать за развитие Release Management, CI/CD и эксплуатацию production-инфраструктуры наших ключевых продуктов.
Обязанности:
-
Поддержка и развитие Observability-стратегии, стандартизация подходов и консультирование команд разработки
-
Обеспечение надежной работы приложений в Kubernetes в production, включая диагностику инцидентов и анализ работы распределенных систем
-
Развитие и поддержка Observability-платформы (metrics/logs/traces), включая стек VM stack, CloudWatch, ELK и сопутствующие инструменты
-
Обеспечение мониторинга, алертинга и дашбордов с учетом архитектуры сервисов и требований production
-
Поддержка команд разработки в вопросах эксплуатации сервисов, инцидентов и взаимодействия между системами
-
Обеспечение полного цикла работы с production-инцидентами: OnCall-реагирование (PagerDuty), координация устранения восстановление сервисов, RCA/Post-Mortem и внедрение reliability improvements по итогам инцидентов
-
Развитие практик Incident Management и reliability engineering, направленных на снижение повторяемости инцидентов и повышение стабильности production-систем
-
3+ года опыта в роли SRE Engineer
-
Практический опыт работы с Observability-стеком (OpenTelemetry, Grafana, Loki, Tempo, Mimir, VictoriaMetrics, ELK, Vector, Sentry)
-
Глубокий опыт работы с Kubernetes в production, включая диагностику и устранение инцидентов
-
Опыт работы с CI/CD (GitLab CI/СD), GitOps (Argo CD), уверенное владение Git и работа с различными моделями ветвления
-
Практический опыт разработки и поддержки Helm chart
-
Опыт работы с контейнеризацией и build-инструментами (Docker, Kaniko, BuildKit)
-
Опыт участия в OnCall и работе с критическими инцидентами
-
Опыт проведения RCA/Post-Mortem и внедрения улучшений reliability
-
Умение работать с кросс-функциональными командами и четко доносить технические решения
-
Проактивность и ориентация на системные улучшения reliability и observability
- участие в развитии международного высоконагруженного продукта;
- сильную инженерную команду с развитой культурой обмена знаниями;
- современный технологический стек без легаси;
- возможность влиять на архитектуру тестовой инфраструктуры и процессы автоматизации;
- конкурентную заработную плату;
- удаленный формат работы.