Аналитик качества продуктовых агентских сценариев
Наша главная задача — придумать критерии и построить надёжные бенчмарки, на которых можно честно сравнивать разные модели между собой в реальных продуктовых сценариях. Вам предстоит формулировать метрики оценки для задач, где модель взаимодействует с сервисами Яндекса (и не только!), и делать эти метрики стабильными. Разработка сред для агентов
Вам предстоит много кодить на Python: оборачивать API сервисов (Маркета, Яндекс Еды и других) в виртуальные среды, в которых будут тестироваться, работать и обучаться наши агенты. Сбор данных и генерация эталонных траекторий для RL
Современные модели учатся через взаимодействие со средой. Вам предстоит формулировать сложные задания и собирать эталонные траектории действий (golden trajectories). Вы будете управлять пайплайнами сбора данных, комбинируя разные подходы: работу с внутренними редакторами, краудсорс и автоматическую разметку через LLM-as-a-judge. Анализ точек роста и погружение в данные
Всё ещё остаются сложные продуктовые сценарии, с которыми модель пока не справляется. Вы будете находить эти узкие места, разбирать проблемы и адаптировать под них бенчмарки. Для этой задачи крайне важна ваша личная насмотренность в текстах и логах моделей: способность «руками» прочувствовать данные и понять, как максимизировать рост качества. Больше об аналитике в Яндексе — в канале Yandex for Analytics* Отлично знаете Python: умеете писать сложный, чистый код (это необходимо для создания виртуальных сред) * Уверенно владеете SQL, любите и умеете анализировать сложные структуры данных с его помощью * Знаете теорию вероятностей и математическую статистику * Понимаете, как устроены агентские системы, или участвовали в их построении * Интересуетесь развитием LLM и хотели бы глубоко погрузиться в эту тему * Очень самостоятельны и готовы браться за SOTA-задачи, для которых нет готовых решений* Взаимодействовали в кросс-сервисных командах * Понимаете, как работает RL (Reinforcement Learning) в контексте языковых моделей * Работали с метриками в NLP или строили синтетические пайплайны генерации данных * Свободно читаете на английском