Senior Site Reliability Engineer (SRE)
Summary
Senior Site Reliability Engineer builds and maintains high-availability cloud infrastructure, sets reliability targets, and automates operations for a large-scale B2B platform using Kubernetes, Prometheus, and observability tools.
О компании
Мы — быстрорастущая продуктовая IT-компания, развивающая масштабную облачную платформу с миллионами операций ежедневно. Наша команда создает высоконадежную инфраструктуру и инженерные процессы, позволяющие быстро запускать новые функции без компромиссов по стабильности.
Ищем Senior Site Reliability Engineer, который поможет вывести надежность платформы на новый уровень (позиция в офисе в Ташкенте).
Чем предстоит заниматься
- Разрабатывать и внедрять SLI/SLO для ключевых сервисов.
- Управлять reliability-показателями и помогать командам находить баланс между скоростью разработки и стабильностью платформы.
- Развивать observability: мониторинг, логирование, трассировку и систему алертинга.
- Координировать работу во время production-инцидентов и снижать время восстановления сервисов.
- Проводить post-mortem разборы и внедрять улучшения, предотвращающие повторение проблем.
- Создавать и поддерживать runbooks и операционные процессы.
- Автоматизировать рутинные задачи и сокращать объем ручной эксплуатации.
- Разрабатывать технические и продуктовые дашборды.
- Настраивать мониторинг критически важных пользовательских метрик.
- Выполнять capacity planning и участвовать в масштабировании инфраструктуры.
- Развивать мониторинг сервисов, баз данных и потоков данных совместно с инженерными командами.
- Анализировать эффективность инфраструктуры и оптимизировать использование ресурсов.
Что мы ожидаем
- Более 5 лет опыта в роли SRE, Production Engineer или Reliability Engineer.
- Отличное понимание современных практик observability.
- Практический опыт работы с Prometheus, Grafana, Loki, Jaeger или аналогичными инструментами.
- Глубокое понимание SLI, SLO, error budgets и Incident Management.
- Опыт эксплуатации Kubernetes и Docker в production.
- Понимание принципов мониторинга распределенных систем, очередей сообщений и высоконагруженных баз данных.
- Умение принимать технические решения самостоятельно и эффективно работать в быстро меняющейся среде.
- Способность сохранять спокойствие во время инцидентов, анализировать причины проблем и доводить задачи до полного устранения.
Мы предлагаем
- Работу над высоконагруженным продуктом с современным технологическим стеком.
- Возможность влиять на архитектурные решения и инженерные процессы.
- Конкурентную компенсацию и бонусную систему.
- Возможности профессионального развития и обучения.
- Команду сильных инженеров и культуру обмена знаниями.
- Гибкий формат работы и минимум бюрократии.
