ML-разработчик в команду алайнмента Alice AI
Summary
Develops and aligns large language models (LLMs) to improve dialogue responses using ML techniques like supervised fine-tuning, reinforcement learning, and reward modeling.
Направление занимается RL-методами для обучения LLM. Мы работаем над ростом качества, стабильностью обучения и инструментами, которые помогают понимать состояние модели во время эксперимента. Задачи могут быть связаны, например, с новыми способами использовать reward-сигнал, оценивать действия модели или регулировать её обновление. Интересные идеи из исследований проверяем на наших моделях, а работающие решения переносим в основной обучающий контур. Интеграция моделей и сборка релиза
Разные эксперименты развивают разные способности модели. Это направление отвечает за то, чтобы объединить изменения в одной версии и сохранить их вклад в итоговое качество. Мы исследуем способы объединения стадий обучения — например, единое обучение, последовательные стадии или On-Policy Distillation. В каждой итерации собираем модель-кандидата, проводим комплексную оценку и уточняем способ интеграции. В рамках направления также поддерживаем актуальный стенд для быстрых экспериментов и приёмки изменений. Системные промпты и управляемость модели
Системный промпт задаёт поведение модели: например, роль, стиль, формат ответа или порядок работы с инструментами. В этом направлении мы учим модель гибко следовать новым системным инструкциям, сохраняя точность, полезность и остальные важные свойства. Мы развиваем методы обучения, данные и оценку поведения модели. Для проверки качества используем, например, экспертную разметку, reward-модели и LLM-as-a-Judge. Отдельное внимание уделяем reasoning, tool calling и переносу качества на новые сценарии. Больше об ML в Яндексе — в канале Yandex for ML* Хорошо знаете классический ML и DL * Понимаете устройство современных LLM и методы их обучения * Умеете переводить исследовательскую задачу в проверяемую гипотезу, эксперимент и метрики * Способны интерпретировать результаты и находить причины изменений качества * Интересуетесь моделями с reasoning и tool calling* Имеете опыт в одной из близких областей: online RL для LLM, многостадийное обучение, distillation, instruction following, reward modeling или оценка поведения языковых моделей