SRE / Observability Engineer (Middle+ / Senior)
Summary
Build and run a centralized observability platform for a large Uzbek bank using VictoriaMetrics, Grafana, and related tools, integrating services end-to-end and setting SLI/SLO-based alerting.
Мы строим единую платформу наблюдаемости для одного из крупнейших негосударственных банков Узбекистана.
Сейчас мониторинг распределен между разными системами, и наша цель - создать централизованную платформу, которая позволит видеть состояние всей инфраструктуры и бизнес-сервисов в одном месте.
Мы ищем инженера, который станет ключевым участником этого проекта и поможет построить observability-платформу практически с нуля.
Чем предстоит заниматься
-
Развивать единую платформу наблюдаемости на базе VictoriaMetrics, VictoriaLogs, Grafana, Vector и Alertmanager.
-
Подключать сервисы к мониторингу "под ключ": от общения с владельцами сервиса до настройки метрик, логов, алертов и дашбордов.
-
Проектировать технические и бизнесовые метрики совместно с командами разработки.
-
Разрабатывать SLI/SLO и строить качественный алертинг без лишнего шума.
-
Участвовать в расследовании инцидентов, писать runbook и postmortem.
-
Формировать стандарты observability для всей компании.
Мы ожидаем
-
Опыт работы SRE, Observability Engineer, Platform Engineer или DevOps от 3 лет.
-
Практический опыт построения систем мониторинга и observability в production.
-
Уверенное понимание Kubernetes на уровне эксплуатации.
-
Опыт работы с Prometheus/Grafana или VictoriaMetrics/VictoriaLogs.
-
Понимание принципов SLI, SLO, Error Budget.
-
Опыт построения алертинга и расследования инцидентов.
-
Понимание Linux, сетей и принципов работы высоконагруженных систем.
Будет плюсом:
-
OpenTelemetry;
-
Loki / ELK / Jaeger / Tempo;
-
Python, Go или Bash;
-
Terraform или Ansible.
Формат работы
Основной формат - работа в офисе в Ташкенте.