ML/AI Engineer
Summary
Builds the engineering core of Bereke Bank's internal AI-agent platform: the agent execution runtime in Python, RAG pipelines over corporate knowledge, tool connectors, and LLM evaluation/observability. Core stack: Python (AsyncIO/FastAPI), LangGraph/LangChain/LlamaIndex, Qdrant, Docker, CI/CD, Langfuse.
Департамент развития AI Bereke Bank создаёт внутреннюю платформу нового поколения: на ней любой сотрудник банка сможет собрать персонального AI-агента из согласованных моделей, корпоративных знаний и инструментов.
Мы ищем ML/AI Engineer-инженера, который станет инженерным ядром нашей выделенной продуктовой команды.
Стек технологий
-
Core: Python (асинхронный стек, FastAPI)
-
AI / LLM: LangGraph, LangChain, LlamaIndex, GigaChain, MCP (Model Context Protocol)
-
Data & Search: Qdrant (или аналоги), Hybrid Search, GraphRAG, SQL, очереди и брокеры сообщений
-
Ops & Observability: Docker, CI/CD, Langfuse, современные трейсинг- и мониторинг-системы
Чем предстоит заниматься:
-
Разрабатывать среду исполнения агентов: ядро платформы на Python (сессии, долгосрочная и контекстная память, планирование, изоляция пользователей, реестр инструментов).
-
Создавать каталог коннекторов и навыков: интеграция Confluence, Jira, GitLab, корпоративной почты, DWH и CRM как переиспользуемых инструментов со строгими контрактами, лимитами и политиками доступа.
-
Строить слой работы со знаниями (RAG): пайплайны обработки корпоративных документов, эмбеддинги, гибридный поиск, ранжирование и валидация релевантности ответов.
-
Выстраивать контур оценки качества (LLM Evaluation): бенчмарки, offline-оценка, LLM-as-a-judge, автотесты и регрессионные прогоны при смене промптов или моделей.
-
Обеспечивать Enterprise-безопасность: совместное проектирование с командами ИБ и IAM (технические аккаунты с минимальными правами, обезличивание/маскирование данных перед отправкой в модели, human-in-the-loop подтверждения, аудит).
-
Управлять наблюдаемостью и unit-экономикой: трейсинг цепочек вызовов, версионирование, мониторинг расхода токенов и оптимизация стоимости сценариев (целевой ориентир — до 100 ₸ за выполнение).
-
Развивать автономность агентов: последовательный переход от read-only ассистентов к сценариям с подтверждением и далее к автономным low-risk операциям.
Что для нас важно:
-
Python от 4–5 лет: глубокое понимание асинхронного программирования (AsyncIO, FastAPI) и опыт промышленной разработки масштабируемых backend-систем.
-
Опыт в Agentic AI: практическое понимание декомпозиции задач, вызова инструментов (tool/function calling), протоколов взаимодействия (MCP или аналоги).
-
Уверенная работа с LLM-фреймворками: LangGraph / LangChain / LlamaIndex на уровне исходного кода и отладки в production.
-
Промышленный RAG: векторные БД (Qdrant или аналоги), чанкинг, эмбеддинги, семантический и гибридный поиск.
-
Инженерная культура: Docker, CI/CD, архитектурное проектирование API (контракты, идемпотентность, устойчивость к сбоям), SQL и очереди сообщений.
-
LLM Observability & Eval: опыт работы с Langfuse или аналогами, настройка приёмочных датасетов и метрик качества.
Будет преимуществом:
-
Опыт создания платформенных решений / SDK и каталогов API для внутренних разработчиков.
-
Знакомство с оркестраторами долгих распределённых процессов (Temporal и др.).
-
Опыт с GraphRAG и мультиагентными архитектурами.
-
Понимание специфики двуязычных (русско-казахских) языковых моделей и оценки их качества.
-
Опыт внедрения AI-ассистентов (Copilot / Cursor / Claude Code) в собственный пайплайн разработки.
Что мы предлагаем:
-
Формат работы: комфортный гибрид (офис в Алматы + удалённые дни), гибкое начало рабочего дня.
-
Влияние на продукт: вы создаете платформу с нуля без легаси, напрямую влияя на архитектуру и стек.
-
Социальный пакет: ДМС, корпоративные скидки и программы развития от банка.