freehire launches on Product Hunt on 26 August.

Follow →

DevOps AI specialist

Summary

Build and run CI/CD, Kubernetes, and AI-agent infrastructure for a fintech product, using AWS/Yandex Cloud, Terraform, Prometheus/Grafana, and model-serving tooling.

Привет!

Сейчас мы активно развиваем новые направления. У тебя будет возможность войти в core-команду финтех-продукта на самом старте и вместе с ИИ-агентами развивать инфраструктуру.

Чем будем заниматься:
  • CI/CD. Построение и сопровождение пайплайнов непрерывной интеграции и доставки (GitHub Actions / GitLab CI), автоматизация сборки, тестирования и деплоя с быстрым откатом;

  • Infrastructure as Code. Описание и версионирование инфраструктуры через Terraform/Pulumi, GitOps-подход, стандартизация окружений dev/staging/prod;

  • Контейнеризация и оркестрация. Управление Docker и Kubernetes, настройка кластеров, networking и ресурсных лимитов;

  • Observability. Настройка мониторинга, логирования и алертинга (Prometheus, Grafana, ELK/Loki, OpenTelemetry), построение дашбордов и распределённого трейсинга;

  • Надёжность и SRE. Определение и поддержка SLA/SLO/SLI, инцидент-менеджмент, postmortem-практики, дежурства on-call, capacity planning;

  • Инфраструктура AI-агентов. Развёртывание и поддержка среды для запуска агентов и агентных циклов (agent loops): оркестрация воркфлоу, управление очередями задач и пулами воркеров;

  • LLM-инфраструктура. Управление model serving, API-шлюзами, балансировкой, rate limiting и фоллбэками;
    роутинг между моделями и провайдерами для отказоустойчивости;

  • Observability агентных циклов. Трассировка вызовов инструментов (tools), метрики числа итераций, латентности, расхода токенов и success rate; защита от «зацикливания» и runaway-процессов;

  • FinOps. Контроль и оптимизация затрат на облако и LLM-API, бюджетирование токенов и ресурсов, алерты по аномальному потреблению;

  • Безопасность и автоматизация. Управление секретами и ключами (Vault), RBAC, sandboxing исполнения агентов, изоляция данных, автоматизация рутинных операций.

Что для этого от тебя необходимо:
  • AWS или Яндекс Облако: опыт от 3 лет;
  • Глубокое понимание distributed systems и failure modes;
  • Advanced observability: metrics, logs, traces, correlation model;
  • Capacity planning, performance и degradation analysis;
  • Recovery / DR / failover design;
  • Понимание cloud / platform failure domains и межсистемных зависимостей;
  • Graceful degradation, load shedding, backpressure, retry budgets, idempotency;
  • Blameless postmortem с контролем corrective actions;
  • Chaos-informed thinking, gamedays и failure injection;
  • Проведение incident review и post-mortem;
  • Проактивность и самостоятельность — готовность действовать без тикетов на каждый шаг;
  • Умение считать стоимость инфраструктуры и принимать решения с оглядкой на cost.
Что предлагаем:
  • Полностью удаленный формат работы с гибким началом рабочего дня, рассматриваем кандидатов вне РФ;
  • Стек без legacy: AWS, Kubernetes, GitLab CI/CD, Grafana + Prometheus, IaC;
  • Открытая корпоративная культура, общение на ты, поддержка инициатив;
  • Работа в технологической компании, которая создаёт сервисы, приносящие пользу миллионам людей;
  • Бенефиты и плюшки для сотрудников.

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available