NLP-разработчик в команду качества претрейна Alice LLM
Summary
NLP developer on Yandex's Alice LLM pretrain-quality team: they build high-quality pretraining datasets (web-sourced and LLM-generated synthetic data), design small-scale experiment setups and scaling-law studies, and support release trainings. Core stack is Python (C++ a plus), with strong ML/LLM expertise.
Один из способов сбора датасета — найти хорошие источники данных и путём их обработки и фильтрации составить качественный датасет. Яндекс — это поисковая компания, и у нас, как правило, есть готовые инструменты для скачивания и обхода веб-страниц. В таком подходе основная часть работы состоит в том, чтобы придумать, как из большого массива данных выделить именно то, что нужно для решения задачи. Генерация синтетических данных
Сейчас для нас это основной способ получения сложных датасетов — например, для кода или математики. В этом подходе важно найти способ составления большого количества разнообразных интересных задач, а затем — разработать эффективный пайплайн их решения при помощи LLM. Иногда для этого нужно обучить специализированную модель для решения тех или иных задач. Разработка экспериментальных сетапов
В работе над претрейном важно правильно выбрать схему проведения экспериментов — так, чтобы их результаты отражали картину на больших обучениях. Поэтому нужно работать над подбором параметров сетапа, исследовать scaling laws, взаимодействовать с аналитиками по вопросам составления бенчмарков. Работа над релизными обучениями
Здесь бывает нужно выбрать правильную схему, этапы обучения и его параметры. Есть также ряд задач, связанных с автоматизацией процесса постановки релизов и их контролем. Больше об ML в Яндексе — в канале Yandex for ML* Хорошо знаете Python — для разработки мы применяем в первую очередь его. Будет плюсом знание C++: некоторые инструменты в Яндексе написаны на нём * Хорошо ориентируетесь в ML, можете применять научный подход к постановке экспериментов и интерпретации результатов * Хорошо понимаете устройство LLM, ориентируетесь в процессе обучения, прочитали техрепорты ключевых опенсорс-моделей, таких как DeepSeek и Qwen * Применяли LLM для решения каких-либо задач, понимаете, как собрать пайплайн на основе LLM для решения той или иной практической задачи Мы понимаем, что на рынке совсем немного компаний, в которых можно заниматься полномасштабными обучениями LLM, поэтому не требуем такого опыта. Тем не менее будет плюсом коммерческий опыт обучения, файнтюнинга, или алайна LLM.