SRE в Поиск
Summary
SRE engineer at Yandex Search team: automating CI/CD, building observability tools, and improving incident response for large-scale web and image search infrastructure.
Вы будете разрабатывать и улучшать механизмы автоматической приёмки и выкатки релизов, минимизируя участие сервисных команд. Это позволит одновременно как повысить надёжность, так и соптимизировать time to market различных внедрений. Разработка инструментов наблюдаемости
У Поиска из-за большого масштаба много специфичных инструментов для обеспечения наблюдаемости на всех стадиях. Это распределённый трейсинг, инструментарий для анализа инцидентов и так далее. Вам предстоит как использовать эти инструменты, так и развивать их. Улучшение процессов координации инцидентов
С появлением LLM можно автоматизировать и упростить значительную часть координации инцидентов. Вы будете улучшать процессы починки аварий, упрощать дебаг сложных инцидентов и ускорять починку. Больше о разработке в Яндексе — в канале Yandex for Developers* Работали с системами мониторинга и управления конфигурациями * Уверенно владеете Linux, имеете крепкую ментальную модель разных подсистем * Понимаете принципы работы TCP/IP и умеете диагностировать сетевые проблемы * Разбираетесь в построении распределённых и отказоустойчивых веб-сервисов * Знакомы с подходами Infrastructure as Code * На хорошем уровне владеете Python или Go* Разрабатывали на системном языке программирования (в идеале C++) * Читали SRE book, понимаете принципы SRE * Понимаете принципы работы очередей и распределённых систем * Умеете анализировать coredumps * Уверенно владеете современными подходами к AI в разработке и поддержке