SRE-инженер (GigaChat)
Summary
SRE-инженер поддерживает и развивает инфраструктуру AI-платформы GigaChat, обеспечивая надежность, масштабируемость и устойчивость к нагрузкам. Работа включает мониторинг, диагностику инцидентов, оптимизацию производительности и взаимодействие с разработчиками.
Мы разрабатываем высоконагруженную платформу на базе искусственного интеллекта **GigaChat**, которая позволит улучшить пользовательский опыт в продуктах Сбера.
Мы строим инфраструктуру, которая должна быть надежной, масштабируемой и устойчивой к высоким нагрузкам. Поэтому нам нужен SRE-инженер, который будет заниматься развитием инфраструктуры, надежностью сервисов, мониторингом и поиском причин сложных инцидентов.* развивать и поддерживать инфраструктуру платформы
* обеспечивать надежность, доступность и производительность сервисов
* участвовать в проектировании и эксплуатации высоконагруженных систем
* настраивать мониторинг, алертинг и наблюдаемость сервисов.
* анализировать и устранять инциденты, включая поиск первопричин.
* оптимизировать производительность приложений и инфраструктуры.
* работать с контейнеризированными приложениями и Kubernetes-кластерами.
* частвовать в автоматизации рутинных операций и эксплуатационных процессов.
* взаимодействовать с разработчиками при разборе проблем производительности и надежности.* уверенные знания Linux.
* практический опыт работы с Docker и Kubernetes.
* опыт работы с системами мониторинга и наблюдаемости:
* VictoriaMetrics;
* Zabbix;
* Grafana;
* Kibana.
* хорошее понимание Kafka и принципов работы распределенных очередей/стриминговых систем.
* опыт работы с PostgreSQL.
* уверенная работа с Git.
* опыт настройки и эксплуатации Nginx.
* понимание принципов построения отказоустойчивых систем.
* умение самостоятельно проводить диагностику проблем и находить их первопричину.
Будет большим плюсом
* опыт эксплуатации высоконагруженных систем.
* глубокое понимание сетевого взаимодействия: TCP/IP, DNS, HTTP/HTTPS, TLS.
* умение диагностировать проблемы сети с помощью Wireshark, tcpdump и стандартных Linux-инструментов.
* опыт работы с HashiCorp Vault и системами управления секретами.
* опыт работы с in-memory cache: Redis и аналогичными решениями.
* понимание принципов работы Kubernetes на уровне control plane, networking и storage.
* опыт автоматизации на Python, Bash или другом скриптовом языке.
* опыт работы с CI/CD.
* понимание принципов SLI/SLO/SLA и error budget.
* опыт проведения postmortem и анализа первопричин инцидентов.* стабильный оклад и премии по результатам работы, ежегодный пересмотр зарплаты
* комфортный современный офис рядом с м.Кутузовская
* гибридный формат работы: встречаемся очно в офисе 1 раз в неделю
* корпоративный спортзал и зоны отдыха
* уникальная система обучения Сбера для профессионального и карьерного развития
* программа адаптации и помощь руководителя на старте
* расширенный ДМС и льготное страхование семьи
* гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
* бесплатная подписка СберПрайм, скидки на продукты компаний-партнеров
* вознаграждение за рекомендацию друзей в команду Сбера
* корпоративная пенсионная программа