Point your AI agent at freehire and let it find you a job.

Get the CLI →

Senior SRE инженер

NewBe an early applicant

Summary

Senior SRE at BetBoom (a betting/gambling company) focused on reliability and observability of a high-load platform of hundreds of microservices. Day to day: keep production stable on Kubernetes (GCP/Yandex Cloud), develop the observability stack (VictoriaMetrics, Grafana, Tempo, Sentry), handle incidents, and build automation tooling in Go.

Наш продукт - это сложная высоконагруженная система (сотни микросервисов), обрабатывающая большие объемы данных.

Наш технологический стек:
Инфраструктура: Managed Kubernetes, GCP, Yandex Cloud, Selectel.
Сети: Cloud, Cilium, Linkerd (Service Mesh).
Observability: Victoriametrics, Grafana, Tempo, Elasticsearch, OTLP, Pyr-oscope, Sentry.
IaaC & CI/CD: Terraform, Terragrunt, Ansible (минимально), GitLab CI.
Сервисы и БД: Node.js, Go (HTTP/gRPC), PostgreSQL (CloudNative-PG), ClickHouse, RabbitMQ, Redis.
Автоматизации: Внутренние инструменты на Go.

Чем вы будете заниматься:

  • Основной фокус на надежность и наблюдаемость:
  • Обеспечение стабильности, доступности и отказоустойчивости production-окружения совместно с командами разработки.
  • Развитие и поддержка системы observability на основе современного стека (Victoriametrics, Grafana, Tempo, Elasticsearch, Pyroscope, Sentry) для полного контроля над системой.
  • Оперативное участие в инцидентах: диагностика, устранение, последующий разбор и реализация мер по предотвращению их повторения.
  • Автоматизация и развитие инфраструктуры: разработка автоматизаций для устранения рутины и повышения надежности (на Golang).

Мы ищем специалиста, который:

  • Имеет опыт работы SRE инженером в высоконагруженных production-средах более 6 лет.
  • Обладает глубоким пониманием Kubernetes и опыт отладки приложений в нем.
  • Обладает глубоким опытом работы с PostgreSQL (не только бэкапы/репликация, а понимание внутреннего устройства: индексы, WAL, запросы)
  • Имеет практический опыт построения и использования систем observability (мониторинг, логи, трейсинг).
  • Понимает принципы сетевого взаимодействия, работы протоколов (HTTP/gRPC) и уметь диагностировать проблемы на этом уровне.
  • Имеет базовые навыки программирования на Go или другом ЯП для создания автоматизаций.
  • Обязательно умеет работать самостоятельно, генерировать задачи и проактивно решать проблемы. Не ждет готовых ТЗ.

See also

SRE jobs by country — openings, pay and top skills →

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available