NLP-разработчик в команду качества претрейна Alice LLM
Summary
ML/NLP engineer improving pre-training of Alice LLM by designing and running heavy experiments, building data pipelines, and training verification/filtration models to boost reasoning quality.
Ставить и анализировать вычислительно тяжёлые эксперименты с претрейн-стадией. Проверять гипотезы об источниках прироста ризонинг-способностей внутри различных срезов умности. Постановка и выбор сетапа эксперимента — это довольно творческий этап. Пайплайны данных
Строить эффективные пайплайны сбора обучающих данных, их синтеза, обработки и фильтрации в новых доменах. Построенные пайплайны предстоит масштабировать и делать более эффективными. Изменение процесса обучения
Модифицировать процесс обучения модели для задач улучшения ризонинга. Внедрять изменения в обучающий пайплайн и оценивать их влияние на качество. Экспертные модели
Обучать модели-верификаторы для проверки качества данных и ответов. Обучать модели для генерации обучающих данных, которые являются SOTA в своём узком домене. Обучать модели-фильтры для отсева некачественных данных. Исследование скейлинга
Исследовать законы скейлинга качества модели с точки зрения данных и вычислений. Определять, как масштабирование влияет на рост рассуждающих способностей в разных доменах. Больше об ML в Яндексе — в канале Yandex for ML* Глубоко разбираетесь в NLP * Знаете Python и разрабатывали на нём* Обучали претрейн-модели в любой из модальностей (NLP, CV, звук, рекомендации) * Строили эффективные CPU/GPU-пайплайны * Погружены хотя бы в одну из областей исследования языковых моделей (RL, архитектуры или данные для LLM)