Point your AI agent at freehire and let it find you a job.

Get the CLI →

Yandex

New

SRE-инженер в команду AI-агентов Фантеха

Posted 4 views
Discussion

Summary

SRE engineer focused on the reliability of AI-driven fintech services. Responsibilities include managing microservices infrastructure, developing observability (SLI/SLO), automating operations with Python, and participating in on-call rotations using tools like Kubernetes and internal Yandex platforms.

Ищем SRE-инженера, который поможет нам повышать надёжность работающих AI‑сервисов, развивать наблюдаемость и готовить инфраструктуру для новых микросервисов. У нас вы сможете повлиять на стабильность систем и на то, как команда проектирует, запускает и эксплуатирует новые продукты.Обеспечивать надёжность AI‑сервисов
Вы будете следить за состоянием работающих сервисов, участвовать в дежурствах, диагностировать нештатные ситуации и устранять их причины. Важно не только восстанавливать работу системы, но и снижать вероятность повторения подобных сбоев. Развивать наблюдаемость
Вам предстоит улучшать мониторинг, логирование и алертинг, определять критичные показатели сервисов и внедрять практики SLI, SLO и error budget. Это поможет команде принимать решения о надёжности на основе данных и раньше замечать проблемы. Помогать запускать новые микросервисы
Вы будете вместе с разработчиками проектировать инфраструктуру новых компонентов, настраивать их развёртывание и интеграцию с общей платформой. В работе мы используем внутренние инструменты Яндекса, включая Yandex Deploy и IDP. Автоматизировать эксплуатацию
Вы станете писать инструменты на Python, развивать CI/CD и автоматизировать создание и настройку инфраструктуры. Цель — уменьшать объём ручных операций и делать запуск изменений предсказуемее. Развивать инженерные практики
Вам предстоит участвовать в проектировании отказоустойчивых решений, разбирать инциденты и помогать команде улучшать процессы разработки и эксплуатации. Больше о разработке в Яндексе — в канале Yandex for Developers* Работали с Linux или другими Unix-системами и умеете диагностировать системные проблемы * Понимаете сетевые протоколы, DNS, HTTP, балансировку и маршрутизацию * Умеете строить мониторинг, анализировать логи и настраивать полезные алерты * Программируете на Python и используете код для автоматизации инфраструктурных задач * Работали с системами оркестрации и Infrastructure as Code: Kubernetes, Terraform, Ansible или аналогами * Понимаете устройство CI/CD и путь изменения от кода до эксплуатации в продакшене * Работали с облачной инфраструктурой * Умеете работать с базами данных, очередями и кешами * Понимаете принципы построения отказоустойчивых распределённых систем * Знакомы с SLI и SLO и готовы участвовать в развитии этих практик * Готовы участвовать в дежурствах и сопровождать критичные сервисы * Умеете обсуждать инфраструктурные и архитектурные решения с разработчиками* Эксплуатировали высоконагруженные системы и занимались capacity planning * Внедряли SLI, SLO и error budget * Обеспечивали надёжность сервисов, взаимодействующих с LLM или внешними API * Знакомы с особенностями наблюдаемости и диагностики AI‑систем * Проводили нагрузочное тестирование и оптимизировали производительность сервисов

Skills

See also

SRE jobs by country — openings, pay and top skills →

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available