Senior SRE инженер
NewBe an early applicantSummary
Senior SRE at BetBoom (a betting/gambling company) focused on reliability and observability of a high-load platform of hundreds of microservices. Day to day: keep production stable on Kubernetes (GCP/Yandex Cloud), develop the observability stack (VictoriaMetrics, Grafana, Tempo, Sentry), handle incidents, and build automation tooling in Go.
Наш продукт - это сложная высоконагруженная система (сотни микросервисов), обрабатывающая большие объемы данных.
Инфраструктура: Managed Kubernetes, GCP, Yandex Cloud, Selectel.
Сети: Cloud, Cilium, Linkerd (Service Mesh).
Observability: Victoriametrics, Grafana, Tempo, Elasticsearch, OTLP, Pyr-oscope, Sentry.
IaaC & CI/CD: Terraform, Terragrunt, Ansible (минимально), GitLab CI.
Сервисы и БД: Node.js, Go (HTTP/gRPC), PostgreSQL (CloudNative-PG), ClickHouse, RabbitMQ, Redis.
Автоматизации: Внутренние инструменты на Go.
Чем вы будете заниматься:
- Основной фокус на надежность и наблюдаемость:
- Обеспечение стабильности, доступности и отказоустойчивости production-окружения совместно с командами разработки.
- Развитие и поддержка системы observability на основе современного стека (Victoriametrics, Grafana, Tempo, Elasticsearch, Pyroscope, Sentry) для полного контроля над системой.
- Оперативное участие в инцидентах: диагностика, устранение, последующий разбор и реализация мер по предотвращению их повторения.
- Автоматизация и развитие инфраструктуры: разработка автоматизаций для устранения рутины и повышения надежности (на Golang).
Мы ищем специалиста, который:
- Имеет опыт работы SRE инженером в высоконагруженных production-средах более 6 лет.
- Обладает глубоким пониманием Kubernetes и опыт отладки приложений в нем.
- Обладает глубоким опытом работы с PostgreSQL (не только бэкапы/репликация, а понимание внутреннего устройства: индексы, WAL, запросы)
- Имеет практический опыт построения и использования систем observability (мониторинг, логи, трейсинг).
- Понимает принципы сетевого взаимодействия, работы протоколов (HTTP/gRPC) и уметь диагностировать проблемы на этом уровне.
- Имеет базовые навыки программирования на Go или другом ЯП для создания автоматизаций.
- Обязательно умеет работать самостоятельно, генерировать задачи и проактивно решать проблемы. Не ждет готовых ТЗ.