Site Reliability Engineer
NewBe an early applicantSummary
An SRE in the Data and Storage group keeps databases (Cassandra, ClickHouse, PostgreSQL), S3-compatible object storage (MinIO to SeaweedFS migration), and Kafka reliable — handling replication, scaling, backups, and incident response. Day-to-day work spans Kubernetes, Ansible, Helm, ArgoCD, and shell automation in a gamedev environment.
Мы ищем SRE-инженера в группу Data and Storage, который возьмёт на себя надёжность баз данных, распределённых хранилищ и связанных с ними инфраструктурных сервисов.
Обязанности:
- Обеспечение надёжной работы кластеров Cassandra, ClickHouse и PostgreSQL: отказоустойчивость, репликация, масштабирование, обновление и восстановление после сбоев.
- Эксплуатация Cassandra Reaper: планирование и контроль repair-процессов с учётом нагрузки на кластеры и pending compactions.
- Эксплуатация и развитие S3-совместимых хранилищ, включая развёртывание SeaweedFS в Kubernetes.
- Миграция с MinIO на SeaweedFS.
- Обеспечение надёжной работы Kafka.
- Развитие собственной системы раздачи игровой статики на базе S3-хранилища, CDN и Nginx: маршрутизация, кэширование и диагностика.
- Поддержка других систем хранения данных и инфраструктурных сервисов.
- Автоматизация инфраструктуры с помощью Ansible, Jinja2 и Shell, развитие GitOps-подхода с Helm и ArgoCD.
- Автоматизация резервного копирования, восстановления и аварийного переключения.
- Проведение HA-тестов, написание runbook-ов и участие в разборе инцидентов.
Требования:
- Опыт работы DevOps / SRE / Platform-инженером от 2–3 лет.
- Практический опыт эксплуатации Cassandra в production.
- Понимание архитектуры Cassandra: replication, consistency levels, repair, compaction и data distribution.
- Опыт эксплуатации PostgreSQL или ClickHouse.
- Опыт работы с распределёнными файловыми или объектными хранилищами.
- Понимание Kubernetes и особенностей эксплуатации stateful-сервисов в нём.
- Опыт работы с Helm и Ansible, умение читать и изменять YAML/Jinja2-конфигурации.
- Опыт автоматизации эксплуатационных задач с помощью Shell/Bash.
- Linux на уровне advanced: systemd, networking, файловые системы, дисковая подсистема и диагностика производительности.
- Понимание принципов высокой доступности, резервного копирования и восстановления данных.
- Опыт управления инцидентами: troubleshooting, root cause analysis и post-mortem
Будет плюсом:
- Опыт эксплуатации крупных Cassandra-кластеров и Cassandra Reaper.
- Опыт работы с SeaweedFS или MinIO.
- Опыт эксплуатации Kafka.
- Опыт построения систем раздачи статического контента на базе S3, CDN и Nginx.
- Опыт работы с GitOps и ArgoCD.
- Умение использовать AI-инструменты в инженерной работе.
Ссылка на Общереспубликанский банк вакансий на информационном портале государственной службы занятости не размещается на основании абз. 5 ст. 34 закона Республики Беларуси "О занятости населения"