SRE-инженер/ инженер по мониторингу
Навыки: Kubernetes, Prometheus, Grafana, PostgreSQL. Специализации: Инженер по доступности сервисов.
О компании
Мы — устойчивый бизнес с 16-летней историей и глубокой экспертизой в телекоме. За годы работы мы выстроили сложное, надежное инженерное ядро и сейчас находимся в точке масштабной трансформации.
Наша цель — превратить сильное IT-наследие в быстрый, предсказуемый и прозрачный конвейер по доставке новых фич. Для этого мы ищем опытного SRE-инженера, который поможет вывести техническую платформу на новый уровень и усилить надежность сервисов.
О роли
Это ключевая техническая роль в компании. Вы будете отвечать за развитие мониторинга, повышение отказоустойчивости и снижение рисков инцидентов. Нам нужен специалист, который умеет мыслить системно, видеть узкие места заранее и не просто поддерживать инфраструктуру, а делать ее лучше, стабильнее и эффективнее.
Роль подойдет тем, кто уверенно работает как с конкретными задачами, так и с верхнеуровневыми постановками, умеет проектировать решения и брать ответственность за результат.
Основные задачи
Вы будете проектировать, развивать и поддерживать систему мониторинга.
В зоне вашей ответственности: обеспечение наблюдаемости и контроля за состоянием сервисов; поиск уязвимостей и слабых мест в работе системы; предложение и внедрение решений по повышению надежности; проведение postmortem-анализов и контроль выполнения corrective actions; снижение времени локализации проблем и улучшение показателей безаварийной работы; участие в развитии платформенных практик и инженерных подходов.
Что важно для этой роли
Мы ищем специалиста с опытом от 5 лет в SRE или DevOps, из них минимум 3 года — с фокусом на построение и развитие систем мониторинга.
Ключевые требования:
глубокое понимание SRE-подходов и практик:
SLO/SLI, Error Budgets, MTBF/MTTR, capacity planning, chaos engineering;
уверенная работа с SQL, умение анализировать и оптимизировать запросы;
опыт работы с Prometheus, PostgreSQL, ClickHouse от 3 лет; опыт разворачивания и администрирования Grafana и Grafana Alerting;
настройка экспортеров, написание PromQL-запросов, работа с scrape-конфигами;
опыт работы с Kubernetes, Helm, Prometheus Operator;
опыт использования Mimir для долгосрочного хранения метрик;
знание Zabbix; умение оптимизировать PromQL и LogQL-запросы, снижая нагрузку на системы сбора метрик.
Дополнительно важно: стабильное проводное интернет-соединение от 30 Мбит/с; наличие собственного компьютерного оборудования.
Какие качества мы ценим
Мы особенно ценим специалистов, которые: умеют расставлять приоритеты и соблюдать сроки; берут ответственность за результат; сохраняют продуктивность в условиях высокой нагрузки; проявляют инициативу и предлагают улучшения; не ждут указаний, а ищут более сильные технические решения и способы оптимизации процессов.
Что мы предлагаем
Формат работы: полный рабочий день без совмещения, с полным фокусом на продукт.
График и формат: 5 дней в неделю по 8 часов; начало работы в удобное время до 11:00 МСК; осознанная удаленка; в целом мы против переработок и выгорания.
Оформление: в штат или по договору ГПХ
Подчинение: управляющему техническому директору
Испытательный срок: 3 месяца
Долгосрочность: рассчитываем на длительное сотрудничество, минимум на 2 года, а в идеале — надолго.
Почему вам может быть интересно
У нас качество сервиса и скорость реакции на инциденты — не формальность, а реальное конкурентное преимущество. Клиенты выбирают наш сервис в том числе за быструю реакцию на проблемы и короткое время решения.
В этой роли вы сможете: влиять на надежность критичных сервисов; строить и развивать систему мониторинга на практике, а не «для галочки»; видеть прямой эффект от своей работы; не только закрывать задачи сверху, но и предлагать собственные сильные инициативы; работать из дома в комфортных условиях и сохранять баланс между работой и личной жизнью.