freehire launches on Product Hunt on 26 August.

Follow →

Senior DevOps observability (SRE) engineer

Summary

Senior DevOps/SRE engineer builds and maintains observability, CI/CD, and Kubernetes infrastructure for a high-load product, using tools like OpenTelemetry, Grafana, and Argo CD.

Мы ищем Senior DevOps observability (SRE) engineer, который будет отвечать за развитие Release Management, CI/CD и эксплуатацию production-инфраструктуры наших ключевых продуктов.

Обязанности:

  • Поддержка и развитие Observability-стратегии, стандартизация подходов и консультирование команд разработки

  • Обеспечение надежной работы приложений в Kubernetes в production, включая диагностику инцидентов и анализ работы распределенных систем

  • Развитие и поддержка Observability-платформы (metrics/logs/traces), включая стек VM stack, CloudWatch, ELK и сопутствующие инструменты

  • Обеспечение мониторинга, алертинга и дашбордов с учетом архитектуры сервисов и требований production

  • Поддержка команд разработки в вопросах эксплуатации сервисов, инцидентов и взаимодействия между системами

  • Обеспечение полного цикла работы с production-инцидентами: OnCall-реагирование (PagerDuty), координация устранения восстановление сервисов, RCA/Post-Mortem и внедрение reliability improvements по итогам инцидентов

  • Развитие практик Incident Management и reliability engineering, направленных на снижение повторяемости инцидентов и повышение стабильности production-систем

Требования:
  • 3+ года опыта в роли SRE Engineer

  • Практический опыт работы с Observability-стеком (OpenTelemetry, Grafana, Loki, Tempo, Mimir, VictoriaMetrics, ELK, Vector, Sentry)

  • Глубокий опыт работы с Kubernetes в production, включая диагностику и устранение инцидентов

  • Опыт работы с CI/CD (GitLab CI/СD), GitOps (Argo CD), уверенное владение Git и работа с различными моделями ветвления

  • Практический опыт разработки и поддержки Helm chart

  • Опыт работы с контейнеризацией и build-инструментами (Docker, Kaniko, BuildKit)

  • Опыт участия в OnCall и работе с критическими инцидентами

  • Опыт проведения RCA/Post-Mortem и внедрения улучшений reliability

  • Умение работать с кросс-функциональными командами и четко доносить технические решения

  • Проактивность и ориентация на системные улучшения reliability и observability

Условия:
  • участие в развитии международного высоконагруженного продукта;
  • сильную инженерную команду с развитой культурой обмена знаниями;
  • современный технологический стек без легаси;
  • возможность влиять на архитектуру тестовой инфраструктуры и процессы автоматизации;
  • конкурентную заработную плату;
  • удаленный формат работы.

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available