Summary
Maintain and automate a large-scale YTsaurus (Hadoop/Spark-like) data platform on Kubernetes, ensuring 24/7 availability, scalability, and observability for data teams.
* Крупный высоконагруженный кластер YTsaurus (аналог Hadoop/Spark) для хранения и обработки петабайтов данных.
* Инфраструктура развернута в Kubernetes с использованием Operator и CRD.
* Задача: обеспечить 24/7 доступность, масштабируемость и автоматизацию платформы для команд Data Engineering и аналитики.* развертывание, конфигурация и сопровождение кластеров YTsaurus в K8s (Helm, Operator)
* управление компонентами: Masters, Data/Tablet/Exec Nodes, Scheduler, Proxies, Query Tracker
* настройка Persistent Volumes, storage locations, replication factor и снапшотов (changelogs/snapshots)
* планирование ресурсов (CPU/RAM/IOPS/Storage) и управление квотами (accounts, pools, bundles)
* разработка безопасных процедур upgrade/rollback и вывода узлов из эксплуатации (drain)
* настройка мониторинга (Prometheus + Grafana + Odin) и сбор логов
* участие в устранении инцидентов, RCA и postmortem
* автоматизация на Python/Bash, управление конфигурацией через Ansible/Terraform
* развитие CI/CD пайплайнов (GitLab)
* управление доступом (ACL, RBAC, токены, группы) и интеграция с Vault.* Опыт от 5 лет в DevOps/SRE/Platform Engineering
* Обязательный опыт эксплуатации YTsaurus в продакшене
* Экспертное знание Kubernetes: StatefulSet, Operators, CRD, Helm, PV/C SI, Network Policies, affinity/taints
* Глубокое знание Linux: I/O, память, cgroups, network stack, диагностика производительности
* Понимание сетей: TCP/IP, DNS, HTTP/HTTPS, TLS, L4/L7 балансировка
* Владение Python и Bash для автоматизации
* Опыт с Ansible, Terraform, GitLab CI/CD
* Навыки работы с Prometheus/Grafana и системами логирования
Будет плюсом:
* знание архитектуры YTsaurus (Cypress, Hydra, Chunks, Tablet Cells, dynamic config)
* опыт с CHYT, SPYT, YQL или Query Tracker
* разработка Kubernetes Operators (Go/Python)
* опыт с Hadoop/HDFS/Spark или ClickHouse/PostgreSQL
* понимание SRE-практик: SLI/SLO, Error Budget, Capacity Planning, Disaster Recovery drills
* опыт multi-cluster / multi-DC инфраструктуры
* нагрузочное тестирование и тюнинг производительности.* стабильный оклад и премии по результатам работы, ежегодный пересмотр зарплаты
* комфортный современный офис рядом с м.Кутузовская
* гибридный формат работы: встречаемся очно в офисе 1 раз в неделю
* корпоративный спортзал и зоны отдыха
* уникальная система обучения Сбера для профессионального и карьерного развития
* программа адаптации и помощь руководителя на старте
* расширенный ДМС и льготное страхование семьи
* гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
* бесплатная подписка СберПрайм, скидки на продукты компаний-партнеров
* вознаграждение за рекомендацию друзей в команду Сбера
* корпоративная пенсионная программа