Point your AI agent at freehire and let it find you a job.

Get the CLI →

Yandex

NewBe an early applicant

NLP-разработчик в команду качества претрейна Alice LLM

Posted
Discussion

Summary

NLP developer on Yandex's Alice LLM pretrain-quality team: they build high-quality pretraining datasets (web-sourced and LLM-generated synthetic data), design small-scale experiment setups and scaling-law studies, and support release trainings. Core stack is Python (C++ a plus), with strong ML/LLM expertise.

Наша цель — создавать модели, которые смогут конкурировать с лучшими LLM на рынке. Мы работаем над кодовыми срезами, а также над STEM и смежными дисциплинами — учим модель решать задачи университетского и PhD-уровня. Вам предстоит подключится к одному из этих двух больших направлений.Сбор данных
Один из способов сбора датасета — найти хорошие источники данных и путём их обработки и фильтрации составить качественный датасет. Яндекс — это поисковая компания, и у нас, как правило, есть готовые инструменты для скачивания и обхода веб-страниц. В таком подходе основная часть работы состоит в том, чтобы придумать, как из большого массива данных выделить именно то, что нужно для решения задачи. Генерация синтетических данных
Сейчас для нас это основной способ получения сложных датасетов — например, для кода или математики. В этом подходе важно найти способ составления большого количества разнообразных интересных задач, а затем — разработать эффективный пайплайн их решения при помощи LLM. Иногда для этого нужно обучить специализированную модель для решения тех или иных задач. Разработка экспериментальных сетапов
В работе над претрейном важно правильно выбрать схему проведения экспериментов — так, чтобы их результаты отражали картину на больших обучениях. Поэтому нужно работать над подбором параметров сетапа, исследовать scaling laws, взаимодействовать с аналитиками по вопросам составления бенчмарков. Работа над релизными обучениями
Здесь бывает нужно выбрать правильную схему, этапы обучения и его параметры. Есть также ряд задач, связанных с автоматизацией процесса постановки релизов и их контролем. Больше об ML в Яндексе — в канале Yandex for ML* Хорошо знаете Python — для разработки мы применяем в первую очередь его. Будет плюсом знание C++: некоторые инструменты в Яндексе написаны на нём * Хорошо ориентируетесь в ML, можете применять научный подход к постановке экспериментов и интерпретации результатов * Хорошо понимаете устройство LLM, ориентируетесь в процессе обучения, прочитали техрепорты ключевых опенсорс-моделей, таких как DeepSeek и Qwen * Применяли LLM для решения каких-либо задач, понимаете, как собрать пайплайн на основе LLM для решения той или иной практической задачи Мы понимаем, что на рынке совсем немного компаний, в которых можно заниматься полномасштабными обучениями LLM, поэтому не требуем такого опыта. Тем не менее будет плюсом коммерческий опыт обучения, файнтюнинга, или алайна LLM.

Skills

See also

AI Engineering jobs by country — openings, pay and top skills →

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available