Инженер эксплуатации платформы SRE
Summary
SRE engineer maintains and scales Kubernetes clusters, CI/CD pipelines, and observability stacks for a high-load infrastructure platform used by large enterprises and government.
Группа Rubytech — лидирующий производитель программно-аппаратных комплексов и разработчик технологий для высоконагруженных ИТ-инфраструктур. Мы выпускаем собственную линейку ПАК Скала^р, а также строим и защищаем от киберугроз инфраструктуру, обеспечивая бесперебойную работу крупного бизнеса и государственных организаций.
Вам предстоит:
• Эксплуатация и администрирование Kubernetes-кластеров (Deckhouse): nodes, networking, storage, RBAC, namespace-изоляция.
• Поддержание и развитие CI/CD-пайплайнов: сборка, тестирование, деплой компонентов платформы.
• Эксплуатация систем управления Скала^р (Геном, Визион, Спектр ИИ): плановое обслуживание, патчинг, конфигурирование.
• Настройка и поддержка стека observability: метрики, логи, трейсы, дашборды, алертинг.
• Выявление аномалий производительности, участие в RCA (root-cause analysis) инцидентов.
• Управление масштабируемостью и оптимизацией ресурсов кластера (HPA, VPA, node autoscaling).
• Разработка и поддержка runbook'ов, автоматизация рутинных операций (IaC, скрипты, операторы).
• Интеграция платформы с корпоративными сервисами: LDAP/AD, DNS, Exchange, S3.
• Участие в дежурстве (on-call), реагирование на инциденты P1/P2 в рамках SLA.
Требования к нашему кандидату:
• Kubernetes (production-grade): deployment, statefulset, daemonset, network policy, PV/PVC, CSI. Знание Deckhouse Kubernetes Platform – преимущество.
• Container runtime: Docker / containerd / CRI-O.
• CI/CD: GitLab CI, ArgoCD или аналоги.
• Observability: Prometheus, Grafana, Loki, Jaeger / OpenTelemetry.
• IaC: Terraform, Ansible или аналоги.
• Networking: overlay-сети (Calico/Cilium), ingress, балансировщики, troubleshooting L3/L4.
• Linux: производительность, системное администрирование, scripting (Bash, Python).
• Понимание принципов SRE: SLI/SLO/SLA, error budgets, change management.
• Базовое понимание компонентов AI/ML-платформ (GPU-scheduling, inference-сервисы) – плюс.
• Навыки работы с корпоративными системами: LDAP, PKI, SIEM-интеграции.
Желательно:
• CKA / CKS
• Опыт работы в enterprise-среде с требованиями ИБ.
Что мы предлагаем:
- Уютный, комфортный и современный офис в пешей доступности от м. Алексеевская, где есть все необходимое для работы и даже больше: дежурный врач, кафе и столовая, кофе и фрукты, фитнес-центр, коворкинг и многое другое.
- Стабильный и «белый» конкурентный доход, который мы обсудим при встрече;
- Удобный график — гибрид или офис (в зависимости от подразделения);
- Работа в аккредитованной ИТ-компании из реестра Минцифры (отсрочка от мобилизации);
- Профессиональный рост, обучение и развитие, участие в проекте «Лекторий Rubytech»;
- Развитые спортивные комьюнити: футбол, волейбол, баскетбол и шахматы;
- ДМС для вас и вашей семьи на особых условиях;
- Тимбилдинги, митапы и другие корпоративные мероприятия;
- Скидки у 500+ партнеров (платформы BestBenefits и Lerna).