DevOps AI specialist
Summary
Build and run CI/CD, Kubernetes, and AI-agent infrastructure for a fintech product, using AWS/Yandex Cloud, Terraform, Prometheus/Grafana, and model-serving tooling.
Сейчас мы активно развиваем новые направления. У тебя будет возможность войти в core-команду финтех-продукта на самом старте и вместе с ИИ-агентами развивать инфраструктуру.
Чем будем заниматься:
-
CI/CD. Построение и сопровождение пайплайнов непрерывной интеграции и доставки (GitHub Actions / GitLab CI), автоматизация сборки, тестирования и деплоя с быстрым откатом;
-
Infrastructure as Code. Описание и версионирование инфраструктуры через Terraform/Pulumi, GitOps-подход, стандартизация окружений dev/staging/prod;
-
Контейнеризация и оркестрация. Управление Docker и Kubernetes, настройка кластеров, networking и ресурсных лимитов;
-
Observability. Настройка мониторинга, логирования и алертинга (Prometheus, Grafana, ELK/Loki, OpenTelemetry), построение дашбордов и распределённого трейсинга;
-
Надёжность и SRE. Определение и поддержка SLA/SLO/SLI, инцидент-менеджмент, postmortem-практики, дежурства on-call, capacity planning;
-
Инфраструктура AI-агентов. Развёртывание и поддержка среды для запуска агентов и агентных циклов (agent loops): оркестрация воркфлоу, управление очередями задач и пулами воркеров;
-
LLM-инфраструктура. Управление model serving, API-шлюзами, балансировкой, rate limiting и фоллбэками;
роутинг между моделями и провайдерами для отказоустойчивости; -
Observability агентных циклов. Трассировка вызовов инструментов (tools), метрики числа итераций, латентности, расхода токенов и success rate; защита от «зацикливания» и runaway-процессов;
-
FinOps. Контроль и оптимизация затрат на облако и LLM-API, бюджетирование токенов и ресурсов, алерты по аномальному потреблению;
-
Безопасность и автоматизация. Управление секретами и ключами (Vault), RBAC, sandboxing исполнения агентов, изоляция данных, автоматизация рутинных операций.
- AWS или Яндекс Облако: опыт от 3 лет;
- Глубокое понимание distributed systems и failure modes;
- Advanced observability: metrics, logs, traces, correlation model;
- Capacity planning, performance и degradation analysis;
- Recovery / DR / failover design;
- Понимание cloud / platform failure domains и межсистемных зависимостей;
- Graceful degradation, load shedding, backpressure, retry budgets, idempotency;
- Blameless postmortem с контролем corrective actions;
- Chaos-informed thinking, gamedays и failure injection;
- Проведение incident review и post-mortem;
- Проактивность и самостоятельность — готовность действовать без тикетов на каждый шаг;
- Умение считать стоимость инфраструктуры и принимать решения с оглядкой на cost.
- Полностью удаленный формат работы с гибким началом рабочего дня, рассматриваем кандидатов вне РФ;
- Стек без legacy: AWS, Kubernetes, GitLab CI/CD, Grafana + Prometheus, IaC;
- Открытая корпоративная культура, общение на ты, поддержка инициатив;
- Работа в технологической компании, которая создаёт сервисы, приносящие пользу миллионам людей;
- Бенефиты и плюшки для сотрудников.