Бэкенд-разработчик в команду надёжности Маркета
Summary
Backend developer on Yandex Market's reliability team: scale 'Hamster' — a production-like pre-prod testing environment — into a production-ready tool covering all Market services, and build incident-management and prevention tooling (bots, dashboards, SLO alerts, CI checks). Core stack is Python with a C++ or Java background, spanning routing, deploy, monitoring and automation.
Сейчас Hamster покрывает ограниченное количество сервисов, и многое в нём на ручном приводе. Предстоит раскатить его на весь Маркет: сделать так, чтобы сервис на любой из наших платформ (фреймворк C++ userver, Java/Kotlin, графовые сервисы) подключался автоматически, а не через полуручную сборку конфигов, доступов, мониторингов и роутинга. Когда инструментом пользуются сотни разработчиков, он сам становится продакшеном, поэтому также предстоит работать над наблюдаемостью и стабильностью Hamster как системы. У нас много архитектурных задач: необходимо продумывать, как связать бета-версии, роутинг трафика, деплой и безопасность, чтобы у разработчика всё завелось по кнопке. Кодогенерация и автоматики в основном на Python, спецификации — на разных языках описания. Развивать инструменты инцидент-менеджмента
Мы отвечаем за то, чтобы инцидент замечали за минуты, чинили быстро и разбирали честно. Предстоит развивать бот, сервисы автоматизации на Python, дашборды и интеграции с трекером задач и внутренней платформой инцидентов: модель приоритетов с автоматической эскалацией, SLA на реакцию и разбор, SLO-алерты, тиры критичности сервисов. Цель — поставить на поток улучшение через инциденты: чтобы из разбора рождались действия и рецидивы находились автоматически. Повышать стабильность сервисов за счёт предотвращения инцидентов
Помимо Hamster, есть и другие способы не доводить проблемы до продакшена: покрывать сервисы проверенными алертами, проводить тестирование на поиск нежелательных зависимостей между сервисами, внедрять всем CI с нужными этапами проверок и многое другое. Здесь есть много векторов работы, которая окажет влияние на весь Маркет. Больше о бэкенде в Яндексе — в канале Yandex for Backend* Разрабатывали бэкенд не менее 3–4 лет * Эксплуатировали сервисы под нагрузкой: дежурили, разбирали инциденты * Уверенно пишете на Python и имеете бэкграунд в C++ или Java (или наоборот: сильны в C++/Java и свободно пишете на Python) * Понимаете, как устроены распределённые системы: балансировка, роутинг трафика, деплой, контейнеры, мониторинг и алертинг * Умеете продумывать архитектуру: связать между собой несколько систем так, чтобы получился работающий инструмент * Готовы много общаться со смежными командами: выяснять потребности, договариваться, доводить изменения в чужих сервисах до конца * Активно используете ИИ-инструменты и агентов в работе и хотите строить на них продукты* Работали с фреймворком C++ userver или другими асинхронными фреймворками для микросервисов * Строили тестовые или предпродовые окружения, канареечные выкладки, зеркалирование трафика * Настраивали L7-балансировщики и понимаете сетевой стек * Писали инструменты для разработчиков: боты, CI-пайплайны, кодогенерацию, внутренние админки * Строили агентные ИИ-пайплайны и скиллы для LLM * Работали в e-commerce и понимаете, как инцидент превращается в потерянные заказы * Знакомы с практиками SRE: SLO, бюджет ошибок, MTTA/MTTR, эскалации * Хотите расти до тимлида: у нас есть такая возможность, если это вам интересно