Point your AI agent at freehire and let it find you a job.

Get the CLI →

Site Reliability Engineer

NewBe an early applicant

Summary

An SRE in the Data and Storage group keeps databases (Cassandra, ClickHouse, PostgreSQL), S3-compatible object storage (MinIO to SeaweedFS migration), and Kafka reliable — handling replication, scaling, backups, and incident response. Day-to-day work spans Kubernetes, Ansible, Helm, ArgoCD, and shell automation in a gamedev environment.

Мы ищем SRE-инженера в группу Data and Storage, который возьмёт на себя надёжность баз данных, распределённых хранилищ и связанных с ними инфраструктурных сервисов.

Обязанности:

  • Обеспечение надёжной работы кластеров Cassandra, ClickHouse и PostgreSQL: отказоустойчивость, репликация, масштабирование, обновление и восстановление после сбоев.
  • Эксплуатация Cassandra Reaper: планирование и контроль repair-процессов с учётом нагрузки на кластеры и pending compactions.
  • Эксплуатация и развитие S3-совместимых хранилищ, включая развёртывание SeaweedFS в Kubernetes.
  • Миграция с MinIO на SeaweedFS.
  • Обеспечение надёжной работы Kafka.
  • Развитие собственной системы раздачи игровой статики на базе S3-хранилища, CDN и Nginx: маршрутизация, кэширование и диагностика.
  • Поддержка других систем хранения данных и инфраструктурных сервисов.
  • Автоматизация инфраструктуры с помощью Ansible, Jinja2 и Shell, развитие GitOps-подхода с Helm и ArgoCD.
  • Автоматизация резервного копирования, восстановления и аварийного переключения.
  • Проведение HA-тестов, написание runbook-ов и участие в разборе инцидентов.

Требования:

  • Опыт работы DevOps / SRE / Platform-инженером от 2–3 лет.
  • Практический опыт эксплуатации Cassandra в production.
  • Понимание архитектуры Cassandra: replication, consistency levels, repair, compaction и data distribution.
  • Опыт эксплуатации PostgreSQL или ClickHouse.
  • Опыт работы с распределёнными файловыми или объектными хранилищами.
  • Понимание Kubernetes и особенностей эксплуатации stateful-сервисов в нём.
  • Опыт работы с Helm и Ansible, умение читать и изменять YAML/Jinja2-конфигурации.
  • Опыт автоматизации эксплуатационных задач с помощью Shell/Bash.
  • Linux на уровне advanced: systemd, networking, файловые системы, дисковая подсистема и диагностика производительности.
  • Понимание принципов высокой доступности, резервного копирования и восстановления данных.
  • Опыт управления инцидентами: troubleshooting, root cause analysis и post-mortem

Будет плюсом:

  • Опыт эксплуатации крупных Cassandra-кластеров и Cassandra Reaper.
  • Опыт работы с SeaweedFS или MinIO.
  • Опыт эксплуатации Kafka.
  • Опыт построения систем раздачи статического контента на базе S3, CDN и Nginx.
  • Опыт работы с GitOps и ArgoCD.
  • Умение использовать AI-инструменты в инженерной работе.

Ссылка на Общереспубликанский банк вакансий на информационном портале государственной службы занятости не размещается на основании абз. 5 ст. 34 закона Республики Беларуси "О занятости населения"

See also

SRE jobs by country — openings, pay and top skills →

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available