SRE Engineer по сопровождению сервиса «мониторинга и журналирования»
Summary
SRE Engineer builds and maintains monitoring/logging infrastructure, automates operations, and supports product teams with observability and incident response using ELK, Kubernetes, VictoriaMetrics, and CI/CD pipelines.
Миссия роли: усилить команду, которая отвечает за
* выстраивание концепции «мониторинга как сервис» в рамках департамента (в том числе встраивание в текущий релизный/производственный процессы департамента),
* сопровождение инфраструктуры мониторинга и журналирования на уровне департамента,
* поддержка продуктовых команд (разбор ошибок при развертывании и настройки мониторинга).* участие в развитии и внедрении концепции «мониторинг/журналирование как сервис» в рамках департамента
* консультирование пользователей и команд разработки по работе с сервисом
* участие в развитии и улучшении инструментов совместно с командой развития «мониторинга и журналирования»
* автоматизация рутинных операционных задач (Python, Groovy, Bash)
* обработка инцидентов (диагностика, устранение, разбор первопричин (RCA))
* планирование и проведение работ по обновлению кластеров/standAlone и их компонентов (от dev до prod)
* разбор проблем связанных с эксплуатацией сервисов на кластерах/standAlone
* настройка self-мониторинга и алертинга для инфраструктуры и работы сервисов «мониторинга и журналирования»
* ведение и актуализация внутренней документации (в том числе FAQ, RunBook/CookBook)
* реализовывать автоматизации для оптимизации внутренних трудозатрат и трудозатрат продуктовых команд.* опыт с ELK, k8s, VictoriaMetrics, PostgreSQL, Kafka, Nginx
* опыт в реализации стандартных практик (арх.патернов) мониторинга и журналирования
* базовые знания Linux (Debian/RHEL-семейство)
* Работа с Git
* понимание контейнеризации (k8s и/или OpenShift)
* навыки написания скриптов для автоматизации: Python и/или Groovy.
* опыт работы с CI/CD пайплайнами (Jenkins pipelines)
* понимание REST API, базовые навыки работы с curl/HTTP
* навыки анализа логов и диагностики сетевых проблем
* понимание принципов сетевого взаимодействия (TCP/IP, DNS, балансировкаL4/L7).
**Будет преимуществом:**
* умение читать и разбирать чужие конфигурации и манифесты (YAML, Helm-чарты)
* способность самостоятельно разобраться в незнакомом сервисе и помочь пользователю
* опыт работы с Helm, Operators, кастомными ресурсами k8s/OpenShift
* опыт работы с Istio и знания об его устройстве.* офис: г Москва, проспект Кутузовский, 32
* офисный формат работы из города Москва
* более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
* расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
* гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
* бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
* вознаграждение за рекомендацию друзей в команду Сбера.