SRE-инженер
Summary
SRE engineer maintains production systems, writes automation scripts, and ensures uptime using Linux, PostgreSQL, Ceph, KVM, and monitoring tools like Zabbix and Prometheus.
- Поддерживать стабильность продакшна, оперативно реагировать на инциденты.
- Проводить периодические плановые тестирования продакшена на отказоустойчивость.
- Писать простые скрипты автоматизации (Bash/Python).
- Мониторить ключевые метрики (CPU, RAM, диск, сеть, latency, ошибки).
- Тюнить ОС и сервисы, оптимизировать конфигурацию.
- Эксплуатировать Ceph (OSD, пулы, CRUSH), Pacemaker (ресурсы, failover, quorum, fence), KVM (ВМ, libvirt), Patroni (кластеры PG, failover).
- Работать с бэкапами (проверять целостность, оценивать RPO и RTO).
- Уверенный Linux‑админ (systemd, journald, dmesg, strace, tcpdump, iostat и т. п.).
- Сетевые знания (TCP/IP, DNS, HTTP, балансировка, файрволы).
- Опыт с PostgreSQL(Patroni), Rabbit, Kafka, Nginx, Ceph, Pacemaker, KVM, Mongodb.
- Мониоринг Zabbix, Grafana, Prometheus.
- Понимание сборки логов на базе стека ELK
- Умение автоматизировать без избыточности.
-
Вы подходите, если:
- Отказоустойчивость для вас не только формальность.
- Решаете своевременно задачи простым и надёжным способом.
- Не копируете готовые решения без понимания подкапотных механизмов.
- Комфортно работаете в консоли .
- Спокойно используете plain‑конфиги, systemd units, bash.
-
Огромным плюсом будет:
- Знания Spine-Leaf архитектуры. Постороение сетей Multi-Pod на базе Evpn+Vxlan, LAG, VRRP, протоколы динамической маршрутизации.
- Умение настраивать Cisco, Mikrotik и другое сетевое оборудование.
- Понимание cgroups, ulimit, sysctl.
- Глубокое понимание специфики Ceph, Pacemaker, KVM, Patroni (диагностика, failover, split‑brain, кворум, NUMA и т. д.).
- Стабильный конкурентный доход;
- 24 календарных дней ежегодного отпуска;
- Пятидневная рабочая неделя;
- Свободную и открытую атмосферу с развитой культурой обратной связи, где ваши идеи и мнение важны.
- Работа гибридного формата