freehire launches on Product Hunt on 26 August.

Follow →

Agent SRE (Site Reliability Engineer for AI Agents) (Blockchain)

Summary

The Agent SRE ensures reliable, scalable, and observable operation of AI agents and RAG systems in a blockchain-based smart contract code generation platform. Daily tasks include managing Kubernetes infrastructure, CI/CD pipelines, monitoring, tracing, and testing agent performance, cost, and safety while optimizing LLM-based workflows.

Мы разрабатываем инновационное решение в области блокчейн-технологий — эффективную систему кодогенерации на новом языке программирования смарт-контрактов с использованием современных LLM-моделей. Наша архитектура построена на основе мультиагентного подхода: несколько AI-агентов взаимодействуют друг с другом, последовательно решая подзадачи от анализа требований до генерации, валидации и оптимизации кода. Мы ищем Agent SRE, который обеспечит надежную, масштабируемую и наблюдаемую эксплуатацию этих агентов. Вам предстоит строить инфраструктуру надежности для ИИ-агента и RAG-систем: управлять их поведением, качеством, стоимостью и безопасностью.* обеспечение надежности, масштабируемости и отказоустойчивости инфраструктуры для запуска агентных систем в Kubernetes * управление CI/CD пайплайнами на базе Jenkins и BitBucket, внедрение GitOps-подходов с использованием Helm для декларативного управления релизами * настройка систем мониторинга, логирования и трейсинга для инфраструктурных компонентов * трейсинг агентов: внедрение трассировки цепочек рассуждений агентов, мониторинг их поведения и производительности. Интеграция с PGVector и Qdrant для отслеживания качества RAG-запросов и семантического поиска * определение и мониторинг SLI — доля успешных генераций кода (success rate), точность (hallucination rate), время выполнения задачи, стоимость токенов * тестирование и валидация агентов: разработка пайплайнов регрессионного тестирования агентов (evals), нагрузочное тестирование агентных систем * внедрение "предохранителей" (circuit breakers) для защиты от каскадных отказов и автоматического ограничения нагрузки при сбоях агентов * мониторинг поведения агентов для обнаружения аномалий и отклонений от штатного режима (rogue detection) * разработка сценариев автономного восстановления агентов при типовых инцидентах без участия человека (self-healing) * перевод инструкций и процедурных знаний (runbook'ов) в исполняемые сценарии для агентов с целью сокращения ручного труда (toil reduction) * планирование работ, оценка задач, ведение документации.### Требования * опыт в роли SRE/DevOps от 3 лет коммерческого опыта эксплуатации высоконагруженных распределенных систем * глубокое понимание Kubernetes (архитектура, операторы, Custom Resources, Helm, сетевые политики), опыт эксплуатации кластеров в ПРОМе * опыт с Jenkins (написание pipeline на Groovy), управление артефактами, интеграция с BitBucket (Git, PR, webhooks) * продвинутый Python - опыт написания скриптов, инструментов автоматизации, API-клиентов, тестов * опыт работы с PGVector и/или Qdrant (развертывание, настройка, оптимизация запросов, мониторинг производительности), с реляционными СУБД PostgreSQL * опыт работы с Prometheus, Grafana, Loki, OpenTelemetry; умение строить SLO/SLI-дашборды и алерты * уверенное владение Jira (ведение задач, эпиков, спринтов, фильтров, дашбордов) * опыт написания юнит-тестов на Python (pytest), интеграционных тестов, опыт нагрузочного тестирования (k6, Locust, JMeter). ### Будет плюсом * опыт работы с ЦФА, блокчейнами, смарт-контрактами * опыт с LLM и агентными фреймворками — понимание архитектуры RAG, работа с LangChain/LlamaIndex, знание особенностей LLM-провайдеров (OpenAI, Anthropic, DeepSeek) * опыт работы с инструментами наблюдаемости для LLM — LangSmith, Weights & Biases, Arize * опыт развертывания и оптимизации GPU-ворклоадов (vLLM, Triton, NVIDIA stack) * опыт Chaos Engineering, опыт тестирования отказоустойчивости (Gremlin, Litmus).* возможность выбрать удобный формат работы: гибрид или офис * комфортный современный офис: Москва, пр. Кутузовский 32к1 * ежегодный пересмотр зарплаты, годовая премия * корпоративный спортзал и зоны отдыха * более 400 образовательных программ СберУниверситета для профессионального и карьерного развития * расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа * ипотека выгоднее до 7% для каждого сотрудника * подписка Прайм с возможностью совместного использования на трёх близких * вознаграждение за рекомендацию друзей в команду Сбера.

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available