freehire launches on Product Hunt on 26 August.

Follow →

Senior Site Reliability Engineer (SRE)

Summary

Senior Site Reliability Engineer builds and maintains high-availability cloud infrastructure, sets reliability targets, and automates operations for a large-scale B2B platform using Kubernetes, Prometheus, and observability tools.

О компании

Мы — быстрорастущая продуктовая IT-компания, развивающая масштабную облачную платформу с миллионами операций ежедневно. Наша команда создает высоконадежную инфраструктуру и инженерные процессы, позволяющие быстро запускать новые функции без компромиссов по стабильности.

Ищем Senior Site Reliability Engineer, который поможет вывести надежность платформы на новый уровень (позиция в офисе в Ташкенте).

Чем предстоит заниматься

  • Разрабатывать и внедрять SLI/SLO для ключевых сервисов.
  • Управлять reliability-показателями и помогать командам находить баланс между скоростью разработки и стабильностью платформы.
  • Развивать observability: мониторинг, логирование, трассировку и систему алертинга.
  • Координировать работу во время production-инцидентов и снижать время восстановления сервисов.
  • Проводить post-mortem разборы и внедрять улучшения, предотвращающие повторение проблем.
  • Создавать и поддерживать runbooks и операционные процессы.
  • Автоматизировать рутинные задачи и сокращать объем ручной эксплуатации.
  • Разрабатывать технические и продуктовые дашборды.
  • Настраивать мониторинг критически важных пользовательских метрик.
  • Выполнять capacity planning и участвовать в масштабировании инфраструктуры.
  • Развивать мониторинг сервисов, баз данных и потоков данных совместно с инженерными командами.
  • Анализировать эффективность инфраструктуры и оптимизировать использование ресурсов.

Что мы ожидаем

  • Более 5 лет опыта в роли SRE, Production Engineer или Reliability Engineer.
  • Отличное понимание современных практик observability.
  • Практический опыт работы с Prometheus, Grafana, Loki, Jaeger или аналогичными инструментами.
  • Глубокое понимание SLI, SLO, error budgets и Incident Management.
  • Опыт эксплуатации Kubernetes и Docker в production.
  • Понимание принципов мониторинга распределенных систем, очередей сообщений и высоконагруженных баз данных.
  • Умение принимать технические решения самостоятельно и эффективно работать в быстро меняющейся среде.
  • Способность сохранять спокойствие во время инцидентов, анализировать причины проблем и доводить задачи до полного устранения.

Мы предлагаем

  • Работу над высоконагруженным продуктом с современным технологическим стеком.
  • Возможность влиять на архитектурные решения и инженерные процессы.
  • Конкурентную компенсацию и бонусную систему.
  • Возможности профессионального развития и обучения.
  • Команду сильных инженеров и культуру обмена знаниями.
  • Гибкий формат работы и минимум бюрократии.