SRE-инженер/ инженер по мониторингу

Open 27d

Навыки: Kubernetes, Prometheus, Grafana, PostgreSQL. Специализации: Инженер по доступности сервисов.

О компании

Мы — устойчивый бизнес с 16-летней историей и глубокой экспертизой в телекоме. За годы работы мы выстроили сложное, надежное инженерное ядро и сейчас находимся в точке масштабной трансформации.

Наша цель — превратить сильное IT-наследие в быстрый, предсказуемый и прозрачный конвейер по доставке новых фич. Для этого мы ищем опытного SRE-инженера, который поможет вывести техническую платформу на новый уровень и усилить надежность сервисов.

О роли

Это ключевая техническая роль в компании. Вы будете отвечать за развитие мониторинга, повышение отказоустойчивости и снижение рисков инцидентов. Нам нужен специалист, который умеет мыслить системно, видеть узкие места заранее и не просто поддерживать инфраструктуру, а делать ее лучше, стабильнее и эффективнее.

Роль подойдет тем, кто уверенно работает как с конкретными задачами, так и с верхнеуровневыми постановками, умеет проектировать решения и брать ответственность за результат.

Основные задачи

Вы будете проектировать, развивать и поддерживать систему мониторинга.

В зоне вашей ответственности: обеспечение наблюдаемости и контроля за состоянием сервисов; поиск уязвимостей и слабых мест в работе системы; предложение и внедрение решений по повышению надежности; проведение postmortem-анализов и контроль выполнения corrective actions; снижение времени локализации проблем и улучшение показателей безаварийной работы; участие в развитии платформенных практик и инженерных подходов.

Что важно для этой роли

Мы ищем специалиста с опытом от 5 лет в SRE или DevOps, из них минимум 3 года — с фокусом на построение и развитие систем мониторинга.

Ключевые требования:

глубокое понимание SRE-подходов и практик:

SLO/SLI, Error Budgets, MTBF/MTTR, capacity planning, chaos engineering;

уверенная работа с SQL, умение анализировать и оптимизировать запросы;

опыт работы с Prometheus, PostgreSQL, ClickHouse от 3 лет; опыт разворачивания и администрирования Grafana и Grafana Alerting;

настройка экспортеров, написание PromQL-запросов, работа с scrape-конфигами;

опыт работы с Kubernetes, Helm, Prometheus Operator;

опыт использования Mimir для долгосрочного хранения метрик;

знание Zabbix; умение оптимизировать PromQL и LogQL-запросы, снижая нагрузку на системы сбора метрик.

Дополнительно важно: стабильное проводное интернет-соединение от 30 Мбит/с; наличие собственного компьютерного оборудования.

Какие качества мы ценим

Мы особенно ценим специалистов, которые: умеют расставлять приоритеты и соблюдать сроки; берут ответственность за результат; сохраняют продуктивность в условиях высокой нагрузки; проявляют инициативу и предлагают улучшения; не ждут указаний, а ищут более сильные технические решения и способы оптимизации процессов.

Что мы предлагаем

Формат работы: полный рабочий день без совмещения, с полным фокусом на продукт.

График и формат: 5 дней в неделю по 8 часов; начало работы в удобное время до 11:00 МСК; осознанная удаленка; в целом мы против переработок и выгорания.

Оформление: в штат или по договору ГПХ
Подчинение: управляющему техническому директору
Испытательный срок: 3 месяца
Долгосрочность: рассчитываем на длительное сотрудничество, минимум на 2 года, а в идеале — надолго.

Почему вам может быть интересно

У нас качество сервиса и скорость реакции на инциденты — не формальность, а реальное конкурентное преимущество. Клиенты выбирают наш сервис в том числе за быструю реакцию на проблемы и короткое время решения.

В этой роли вы сможете: влиять на надежность критичных сервисов; строить и развивать систему мониторинга на практике, а не «для галочки»; видеть прямой эффект от своей работы; не только закрывать задачи сверху, но и предлагать собственные сильные инициативы; работать из дома в комфортных условиях и сохранять баланс между работой и личной жизнью.