ML-разработчик в команду базового алайнмента Alice AI LLM
Summary
Develops and aligns large language models (LLMs) to improve dialogue responses using ML techniques like supervised fine-tuning, reinforcement learning, and reward modeling.
Наша команда занимается стадией алайнмента Alice AI LLM. Мы превращаем LLM в диалогового агента, способного выполнить широкий спектр запросов пользователя. Приходите к нам, если знаете классические методы ML и NLP, понимаете, как устроены LLM, и хотите строить будущее вместе с нами!Обучение следованию инструкциям пользователя (Supervised Fine-tuning, SFT)
Чтобы превратить предобученную LLM в диалогового агента, нужно собрать множество демонстраций желаемого поведения модели на разнообразных задачах. Какие именно задачи важнее, насколько сложными могут быть демонстрации, каких навыков модели не хватает для решения конкретной задачи и как модель может выучить этот навык на стадии алайнмента? Это примеры вопросов, на которые мы ищем ответы с помощью ML-экспериментов. Обучение модели на основе пользовательских предпочтений и верифицируемых наград (RLHF, RLVR)
После стадии SFT качество ответов модели даже на один и тот же запрос может очень сильно различаться. Мы собираем разметку относительного качества ответов модели и учим её генерировать ответы наилучшего качества. На этом этапе мы применяем алгоритмы online-RL (GRPO, GSPO) и используем комбинацию стадий RLHF и RLVR. Также мы занимаемся обучением с одновременным учётом нескольких аспектов качества. Обучение модели наград (Reward Modeling)
Разметка качества ответов людьми — очень дорогой и небыстрый процесс, а алгоритмы online-RL требуют оценки в реальном времени. Мы развиваем свою линейку reward-моделей, которые могут быстро оценивать качество ответа модели на уровне человека. Кроме базового обучения моделей наград, мы применяем подходы с использованием рубрицированных оценок, а также используем LLM-as-a-Judge (LLMaJ) напрямую. Объединение экспертных моделей
Мы занимаемся объединением экспертных моделей, обученных на разных доменах, в единую модель, которая сочетает в себе сильные качества каждой из них. Для этого мы активно исследуем и применяем такие методы, как On-Policy Distillation (OPD). Больше об ML в Яндексе — в канале Yandex for ML* Отлично знаете классические методы ML и NLP * Понимаете, как устроены современные LLM, решали с их помощью прикладные задачи или имеете релевантный исследовательский опыт
Чтобы превратить предобученную LLM в диалогового агента, нужно собрать множество демонстраций желаемого поведения модели на разнообразных задачах. Какие именно задачи важнее, насколько сложными могут быть демонстрации, каких навыков модели не хватает для решения конкретной задачи и как модель может выучить этот навык на стадии алайнмента? Это примеры вопросов, на которые мы ищем ответы с помощью ML-экспериментов. Обучение модели на основе пользовательских предпочтений и верифицируемых наград (RLHF, RLVR)
После стадии SFT качество ответов модели даже на один и тот же запрос может очень сильно различаться. Мы собираем разметку относительного качества ответов модели и учим её генерировать ответы наилучшего качества. На этом этапе мы применяем алгоритмы online-RL (GRPO, GSPO) и используем комбинацию стадий RLHF и RLVR. Также мы занимаемся обучением с одновременным учётом нескольких аспектов качества. Обучение модели наград (Reward Modeling)
Разметка качества ответов людьми — очень дорогой и небыстрый процесс, а алгоритмы online-RL требуют оценки в реальном времени. Мы развиваем свою линейку reward-моделей, которые могут быстро оценивать качество ответа модели на уровне человека. Кроме базового обучения моделей наград, мы применяем подходы с использованием рубрицированных оценок, а также используем LLM-as-a-Judge (LLMaJ) напрямую. Объединение экспертных моделей
Мы занимаемся объединением экспертных моделей, обученных на разных доменах, в единую модель, которая сочетает в себе сильные качества каждой из них. Для этого мы активно исследуем и применяем такие методы, как On-Policy Distillation (OPD). Больше об ML в Яндексе — в канале Yandex for ML* Отлично знаете классические методы ML и NLP * Понимаете, как устроены современные LLM, решали с их помощью прикладные задачи или имеете релевантный исследовательский опыт