SRE в WB Cloud
Обеспечивать надежность и доступность сервисов (SLA/SLO);
Анализировать и устранять узких места в инфраструктуре;
Разрабатывать и внедрять SRE-практики: error budgets, postmortems;
Управлять аллертами и снижать уровень шума (Alertmanager, Grafana);
Оптимизировать работу BigData-кластеров (Kafka, ClickHouse, Flink);
Автоматизировать реагирования на инциденты;
Тесно взаимодействовать с Dev-командами для улучшения observability.
Опыт в SRE/DevOps от 3 лет;
Глубокое понимание SRE-принципов;
Навыки работы с Kubernetes и распределенными системами;
Опыт настройки и анализа метрик/логов (PromQL, Loki, Elasticsearch);
Умение писать код для автоматизации (Python, Go, Bash);
Опыт управления инцидентами и проведения postmortem-аналитики.
Обучение и развитие: языковые клубы, собственный корпоративный университет, программы развития управленческих навыков и многое другое;
Благополучие сотрудников: корпоративный пакет ДМС со стоматологией, корпоративный спорт, консультации психолога и дополнительные возможности аккредитованной IT-компании;
Множество сообществ: клуб спикеров, футбола, йоги, шахмат и т.д.;
Забота о семьях: создаем условия, в которых легко сочетать карьеру и заботу о близких – от гибкого подхода до масштабных проектов для детей сотрудников;
Скидки и партнерские программы: на обучение, страхование, покупки и многое другое;
Комфортная рабочая среда: бесплатное питание в офисе, современные офисы рядом с метро, корпоративная техника и портал для сотрудников.