ML Engineer / Research Engineer — обучение LLM с нуля
Summary
Research and develop large language models from scratch, designing data pipelines and training strategies to improve model capabilities like reasoning and coding at web-scale.
Современные LLM обучаются на триллионах токенов, но объём корпуса сам по себе не гарантирует качество. Важно понять, какие данные действительно развивают способности модели. Вы будете исследовать: * какие источники дают наибольший прирост качества; * как данные влияют на знания, reasoning, coding и другие способности; * как сочетать веб-данные, специализированные корпуса и синтетику; * как выбирать оптимальное соотношение доменов и языков; * как менять состав обучающей смеси по ходу претрейна; * как масштабировать выводы небольших экспериментов на крупные модели. Обучение моделей с нуля
Вы пройдёте полный цикл создания новой LLM: * сформулируете гипотезу; * подготовите экспериментальный датасет; * запустите обучение proxy-моделей; * проведёте абляции и проанализируете результаты; * определите, как подход ведёт себя при масштабировании; * перенесёте успешные изменения в обучение большой модели. Предстоит работать не только с финальными метриками, но и с динамикой обучения: исследовать, как разные способности возникают и развиваются по мере претрейна. Scaling laws и раннее прогнозирование качества
Обучение большой модели требует значительных вычислительных ресурсов, поэтому особенно важно заранее понимать, какие решения стоит масштабировать. Вы будете: * строить scaling laws для данных и моделей; * разрабатывать proxy-эксперименты; * прогнозировать качество большой модели по малым запускам; * искать ранние сигналы будущих способностей; * выбирать оптимальные конфигурации обучения при заданном вычислительном бюджете. Работа с данными большого масштаба
Исследовательские идеи необходимо превращать в надёжные процессы, способные работать на web-scale. Вам предстоит развивать обработку веб-корпусов, фильтрацию и ранжирование документов, дедупликацию, балансировку языков и доменов, автоматическое обновление датасетов, распределённые пайплайны обработки данных. Роль сочетает research и engineering: нужно уметь как придумать и проверить гипотезу, так и довести успешный метод до масштаба реального претрейна. Больше об ML в Яндексе — в канале Yandex for ML* Хорошо знаете Python * Имеете опыт в ML, NLP, LLM или других областях deep learning * Понимаете принципы работы и обучения трансформеров * Умеете формулировать гипотезы и ставить контролируемые эксперименты * Способны анализировать результаты и находить причины изменений качества * Умеете читать исследовательские статьи и оценивать применимость идей на практике * Готовы работать с задачами, для которых ещё нет готовых решений Необязательно соответствовать всем пунктам: сильного опыта в нескольких из них уже достаточно.* Знакомы с любыми из этих областей: претрейн или посттрейн LLM, PyTorch и распределённое обучение, обработка больших данных, подготовка обучающих корпусов, scaling laws, evaluation LLM, synthetic data, обучение моделей на GPU-кластерах