ML-инженер в разработку агентов для AI-приложения в Международном Поиске
Мы разрабатываем AI-приложение, которое решает задачи пользователя с помощью агентов разного профиля. Ищем ML-инженера, который будет развивать компоненты агентов и собирать новых: инструменты, поиск по базе знаний, оркестрацию, оценку качества — на реальном трафике десятков миллионов пользователей.Разработка и развитие агентов
Большой агент — это не одна модель, а набор компонентов: роутинг между сценариями, инструменты и их описания, поиск по внутренней базе знаний, работа с памятью и контекстом диалога, обработка ошибок и передача диалога человеку. Вы будете разрабатывать, дорабатывать и поддерживать эти компоненты — в первую очередь в телеком-агенте как самом крупном сценарии, — а также собирать с нуля новых агентов под другие профили. Отдельный пласт — надёжность: чтобы агент не галлюцинировал и не совершал действий, которых пользователь не просил. Исследование SOTA-подходов
Агентные системы — одна из самых быстро меняющихся тем в LLM: подходы к планированию, памяти, reflection и обучению агентов на собственном опыте выходят почти каждый день. Вы будете изучать новые методы, отбирать применимое к нашим сценариям и создавать собственные подходы. Проверка гипотез
Вам предстоит реализовывать свои гипотезы в виде прототипов полного цикла: от сбора и разметки данных до офлайн-оценки, A/B-теста на реальных пользователях и выката в прод. Оценка качества
Для агентов нет готовых метрик — их приходится строить самим. Вы будете разрабатывать симуляции диалогов, автоматических оценщиков (LLM-as-a-judge) и наборы сценариев, по которым видно, что новая версия агента действительно лучше предыдущей. Больше об ML в Яндексе — в канале Yandex for ML* Много работали с трансформерами, большими генеративными моделями и SOTA-архитектурами * Имеете опыт и обширный кругозор в NLP * Умеете строить агентные пайплайны: tool calling, RAG, оркестрацию, оценку качества * Заботитесь о конечном продукте и готовы глубоко погружаться в данные: логи диалогов, реальные обращения пользователей, разборы ошибок агента* Публиковались в журналах или на топовых конференциях * Выводили агентов или LLM-ассистентов в прод под реальной нагрузкой * Работали с мультиязычными моделями и low-resource-языками * Дообучали модели под агентные задачи: SFT, RLHF/RLAIF, distillation * Имеете опыт в телеком-домене или в клиентском сервисе либо поддержке
Большой агент — это не одна модель, а набор компонентов: роутинг между сценариями, инструменты и их описания, поиск по внутренней базе знаний, работа с памятью и контекстом диалога, обработка ошибок и передача диалога человеку. Вы будете разрабатывать, дорабатывать и поддерживать эти компоненты — в первую очередь в телеком-агенте как самом крупном сценарии, — а также собирать с нуля новых агентов под другие профили. Отдельный пласт — надёжность: чтобы агент не галлюцинировал и не совершал действий, которых пользователь не просил. Исследование SOTA-подходов
Агентные системы — одна из самых быстро меняющихся тем в LLM: подходы к планированию, памяти, reflection и обучению агентов на собственном опыте выходят почти каждый день. Вы будете изучать новые методы, отбирать применимое к нашим сценариям и создавать собственные подходы. Проверка гипотез
Вам предстоит реализовывать свои гипотезы в виде прототипов полного цикла: от сбора и разметки данных до офлайн-оценки, A/B-теста на реальных пользователях и выката в прод. Оценка качества
Для агентов нет готовых метрик — их приходится строить самим. Вы будете разрабатывать симуляции диалогов, автоматических оценщиков (LLM-as-a-judge) и наборы сценариев, по которым видно, что новая версия агента действительно лучше предыдущей. Больше об ML в Яндексе — в канале Yandex for ML* Много работали с трансформерами, большими генеративными моделями и SOTA-архитектурами * Имеете опыт и обширный кругозор в NLP * Умеете строить агентные пайплайны: tool calling, RAG, оркестрацию, оценку качества * Заботитесь о конечном продукте и готовы глубоко погружаться в данные: логи диалогов, реальные обращения пользователей, разборы ошибок агента* Публиковались в журналах или на топовых конференциях * Выводили агентов или LLM-ассистентов в прод под реальной нагрузкой * Работали с мультиязычными моделями и low-resource-языками * Дообучали модели под агентные задачи: SFT, RLHF/RLAIF, distillation * Имеете опыт в телеком-домене или в клиентском сервисе либо поддержке