freehire launches on Product Hunt on 26 August.

Follow →

SRE-инженер (Site Reliability Engineer)

Summary

SRE engineer monitors and maintains production systems, responds to incidents, and ensures reliability using PostgreSQL, monitoring tools (Zabbix, Prometheus), and cloud platforms (AWS/Yandex/Selectel).

Обязанности:
  • Управление инцидентами (L2/L3), эскалация и оперативное решение проблем

  • Анализ логов и метрик (ELK, Zabbix и др.)

  • Поддержка сервисов и участие в разборе инцидентов в продакшене

  • Сопровождение релизов, контроль изменений

  • Работа с PostgreSQL (диагностика, анализ данных, SQL-запросы)

  • Настройка мониторинга, определение критичных метрик и алертов

  • Контроль и участие в формировании SLI / SLO

  • Взаимодействие с разработчиками при поиске причин инцидентов

  • Проведение постмортем‑анализа и улучшение стабильности систем

  • Ведение задач в Jira, документации в Confluence

Требования:
  • Опыт работы в роли SRE / Production Support / L2-L3 Engineer от 2 лет

  • Понимание принципов SLI / SLO и incident management

  • Опыт работы с мониторингом (Zabbix, Prometheus или аналогичные системы)

  • Уверенную работу с реляционными БД (PostgreSQL)

  • Опыт работы с облаками (AWS / Yandex Cloud / Selectel)

Будет плюсом

  • Опыт настройки и администрирования Zabbix
  • Опыт работы с Elasticsearch / ELK‑стеком (настройка индексов, алертов, дашбордов)
  • Опыт работы с Kubernetes (на уровне понимания)
  • Опыт работы с Helm / Terraform (на уровне понимания)
  • Опыт в финтехе или высоконагруженных системах
Условия:
  • Официальное трудоустройство
  • Дежурства (без ночных смен, раз в 3 недели)

See also