SRE-инженер по мониторингу и Observability
Summary
SRE engineer builds and maintains observability for high-load systems: Prometheus/Grafana dashboards, metrics, traces, alerts, and incident RCA to keep services reliable.
-
Обеспечение полного жизненного цикла наблюдаемости информационных систем (далее ИС):
- Формирования требований и подключение новой ИС;
- Настройки метрик, распределённой трассировки, дашбордов, панелей, алертинга, диагностики инцидентов;
- Улучшение метрик и пороговых значений по результатам RCA.
- Опыт работы с мониторингом, SRE, DevOps или эксплуатацией высоконагруженных систем от 3 лет;
- Практический опыт администрирования Prometheus и Grafana;
- Уверенное знание PromQL;
- Опыт создания технических и сервисных дашбордов;
- Опыт настройки alerting rules, Alertmanager либо аналогичных механизмов;
- Понимание принципов distributed tracing и APM;
- Понимание различий и взаимосвязи между метриками, логами, трассами, событиями и профилями;
- Опыт мониторинга Linux, виртуальных машин, контейнеров и Kubernetes;
- Понимание HTTP, REST API, DNS, TCP/IP, TLS и балансировки нагрузки;
- Опыт мониторинга баз данных, брокеров сообщений, веб-серверов и интеграционных компонентов;
- Знание подходов RED, USE и Four Golden Signals;
- Понимание SLI, SLO, SLA и error budget;
- Навыки расследования инцидентов и поиска первопричины;
- Умение читать архитектурные и сетевые схемы;
- Опыт написания эксплуатационной документации и runbooks;
- Умение переводить технические показатели в понятное описание влияния на сервис и пользователей;
- Способность самостоятельно взаимодействовать с разработкой, DevOps, эксплуатацией и владельцами ИС.
Будет плюсом:
- Опыт работы с «Ключ-АСТРОМ», Dynatrace, AppDynamics, Datadog APM, New Relic или аналогичными APM-платформами;
- Опыт работы с OpenTelemetry;
- Опыт инструментирования приложений на Python, Go и PHP;
- Опыт работы с Loki, OpenSearch, Elasticsearch или другими системами централизованного хранения логов;
- Опыт мониторинга Kafka, IBM MQ, RabbitMQ, PostgreSQL, MongoDB, Redis, Nginx и Kubernetes;
- Знание Thanos, VictoriaMetrics, Mimir или других решений долгосрочного хранения метрик;
- Опыт создания synthetic monitoring и end-to-end проверок;
- Навыки Python, Bash, Ansible, Terraform или GitLab CI;
- Опыт управления конфигурацией мониторинга по модели GitOps/Infrastructure as Code;
- Опыт построения мониторинга критичных бизнес-сервисов с высоким SLA;
- Участие в postmortem/RCA и аварийных учениях.
- Гибридный формат работы. Офис — в Москве: современное пространство в 5 минутах от м. Новокузнецкая (фитнес-зал, настольный теннис, комната PS 5, регулярные активности для резидентов), в Санкт-Петербурге: коворкинг в 10 минутах от м. Маяковская (PS 5, еженедельные вечеринки).
-
Работа в аккредитованной ИТ-компании со всеми предусмотренными государственными льготами, включая ИТ-ипотеку.
-
Полностью «белая» заработная плата. Уровень дохода обсуждается индивидуально и зависит от опыта и экспертизы.
-
ИТ-отсрочка и бронь от мобилизации как для сотрудников компании с критически важной инфраструктурой.
-
Корпоративные льготы на авиабилеты авиакомпаний «Аэрофлот», «Россия» и «Победа» для сотрудника и членов семьи (родители, супруг(а), дети).
-
ДМС с первого рабочего дня: стоматология, помощь на дому, плановый и экстренный стационар; возможность подключения семьи на льготных условиях.
-
Компенсация питания при работе из офиса.
-
Курсы, сертификации, профессиональные конференции.
-
Корпоративный сервис благополучия: безлимитные консультации с экспертами по юридическим, психологическим, финансовым вопросам и вопросам здорового образа жизни.
-
Корпоративные мероприятия и активности: спорт, киберспорт, мотопробеги и другие форматы внерабочего общения.
-
Дополнительно: кафетерий скидок, доступ к корпоративной библиотеке Alpina Digital, билеты на футбольные и баскетбольные матчи.