freehire launches on Product Hunt on 26 August.

Follow →

Senior Site Reliability Engineer (SRE)

Summary

Leads reliability engineering for a fast-growing SaaS platform serving 6,000+ retail brands, defining SLOs, observability stacks, and incident response to keep services stable and scalable.

BILLZ — это часть экосистемы TBC Uzbekistan и один из самых быстрорастущих SaaS-продуктов в регионе. Мы помогаем автоматизировать учет, продажи и аналитику более чем 6 000 магазинам, среди которых Levi’s, Mango, Calvin Klein, L’Occitane и Yves Rocher.

Мы растем, и сейчас нам нужен сильный инженер, который возглавит направление надежности наших сервисов, станет мостом между бизнесом и разработкой и будет управлять стабильностью платформы.

Чем предстоит заниматься:
— Определение и поддержание SLO/SLI для критически важных сервисов;
— Управление error budget и балансирование скорости разработки с надёжностью;
— Построение observability: метрики и дашборды (Prometheus, Grafana), логирование (Loki), трейсинг (Jaeger); — Проектирование осмысленного, не шумного алертинга, ориентированного на пользователя;
— Координация реагирования на инциденты (incident commander), снижение MTTR;
— Проведение blameless post-mortem и внедрение мер по предотвращению повторений;
— Создание и поддержание runbooks для операционных процедур;
— Автоматизация toil-задач для освобождения времени на инженерную работу;
— Создание дашбордов бизнес- и продуктовых метрик с привязкой к техническим показателям;
— Настройка алертов на критичные продуктовые метрики (падение конверсии, рост времени загрузки);
— Capacity planning на основе прогнозов роста бизнеса;
— Обеспечение observability для feature flags и A/B тестов;
— Мониторинг слоя данных (PostgreSQL, ClickHouse, ElasticSearch) в связке с DBA;
— Мониторинг financial-метрик инфраструктуры (cost per transaction, infrastructure ROI).

Что мы ждем от тебя:
— Опыт работы SRE / Reliability / Production Engineer от 5+ лет
— Экспертное владение observability-стеком (Prometheus, Grafana, Loki, Jaeger)
— Глубокое понимание концепций SLO/SLI, error budgets и практик Incident Management
— Знакомство с инфраструктурой и контейнеризацией (Kubernetes, Docker) на уровне эксплуатации
— Знакомство с сервисами на Golang, очередями Apache Kafka и спецификой мониторинга БД (PostgreSQL, ClickHouse, ElasticSearch)
— Способность работать с задачами высокой неопределённости и готовность менторить коллег
— Высокая эмоциональная устойчивость во время сбоев, «холодная голова», умение аргументировать решения и дожимать проблемы до полного устранения

Что предлагаем:
— Работа в одной из самых быстрорастущих tech-компаний региона
— Влияние на развитие продукта и технические решения
— Официальное оформление с первого дня
— Обучение, развитие и поддержка команды профессионалов

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available