Team Lead SRE-команды
Summary
Lead a 5-person SRE team at VK building and running core internal cloud components (DNS, secret storage, L4/L7 balancers, build/deploy system, Linux/hardware tooling). Day-to-day is managing reliability via SLO/SLA/SLI, incident management, and reducing incidents and manual ops, requiring 5+ years in a similar role plus senior-level Go/Java, networking, and Linux skills.
Подсистемы в зоне ответственности команды
- DNS
- хранилище секретов
- балансировщики L4/L7
- хранилище настроек приложений
- система сборки и деплоя
- клиентские библиотеки
- инструментарий работы с железом
- всё, что работает на стыках управляющего слоя облака, Linux и железа
Ожидаемые результаты
- Снижение числа инцидентов
- Снижение числа ручных вмешательств
- Рост удовлетворённости пользователей и коллег
Задачи
- Управление командой SRE из 5 человек
- Управление надёжностью внутреннего облака (SLO/SLA/SLI)
- Инцидент-менеджмент
- Работа с потребностями пользователей
- Удовлетворение текущих и будущих потребностей бизнеса
Требования
- Опыт работы на аналогичной позиции от 5 лет
- Опыт разработки Go/Java - на уровне Senior
- Понимание основ работы сети и сетевых протоколов
- Уверенные знания Linux
- Продуктовый подход в достижении целей
