freehire launches on Product Hunt on 26 August.

Follow →

Старший DL-разработчик в команду ризонинга

Open 65d
Мы работаем над инженерией данных для различных стадий обучения моделей. Наша модель должна не только хорошо решать сложные математические проблемы, но и быть полезной на широком наборе задач. Откликайтесь, если отлично знаете математику, классические алгоритмы и структуры данных, пишете на Python.Создание новых наборов данных
Разнообразие вопросов к LLM растёт. Но модели, которые щелкают математику как орешки, могут плохо справляться с задачами из других областей. Чтобы повысить качество рассуждений и ответов, необходимы данные различных уровней сложности и тематик. Вы сможете задействовать свои профессиональные компетенции, создавая подобные наборы задач. Улучшение функций награды
В эффективном обучении модели навыкам ризонинга ключевую роль играет функция награды. Благодаря ей модель учится выбирать корректные стратегии — скажем, выстраивать более лаконичные цепочки рассуждений, не снижая качества ответа. Однако в задачах, где результат непросто верифицировать (в отличие от, например, программирования или математических расчётов), создание такой функции становится серьёзным испытанием. Вашей задачей будет разработка надёжной функции награды. Развитие процедуры обучения
Оптимальная конфигурация обучения рассуждающих моделей — открытый исследовательский вопрос. Существуют различные направления для экспериментов: on-policy- и off-policy-обучение, адаптивное управления энтропией модели, способы расчёта advantage. Также требует внимания выбор подходящего функционала для минимизации, например, для Dense- и MoE-архитектур. Вы будете проводить подобные исследования и находить лучшие настройки для достижения поставленных целей. Больше об ML в Яндексе — в канале Yandex for ML* Отлично знаете математику, классические алгоритмы и структуры данных * Умеете программировать на Python * Разбираетесь в Reinforcement Learning. Вас не пугают такие слова, как GAE, PPO, GRPO и другие версии policy optimization * Имеете практический опыт в распределённом обучении больших моделей на основе архитектуры Transformer * Понимаете, как устроена стадия alignment'а современных LLM* Обучали рассуждающие (reasoning) модели * Работали c инфраструктурой для RL-обучения: VERL, vLLM, SGLang, etc.

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available