freehire launches on Product Hunt on 26 August.

Follow →

Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat

Open 29d

Summary

Leads online reinforcement learning and post-training for GigaChat, designing experiments, optimizing pipelines, and scaling LLM improvements in a Moscow-based team.

Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели. Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат.* разрабатывать и улучшать методы online RL * реализовывать и дорабатывать подходы post-training и online RL * проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин * разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач * следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру * строить и развивать инфраструктуру обучения * разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели * обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций * оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест * выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять * работать с данными и системой оценки качества * участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки * строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек * анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения * тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры * брать на себя ответственность за целые куски системы: от идеи до результата в проде * делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества.### * отличное владение Python и PyTorch * практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях * опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы * понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги. * Умение писать чистый, надёжный, production-ready код * способность разбираться в сложных системах и самостоятельно находить и устранять узкие места. **Будет плюсом:** * опыт работы с reward-моделями, process reward models, LLM-as-a-judge * опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач * опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang и т.д.) * понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL и др.) * публикации, open-source вклад или сильный прикладной track record.* возможность выбрать удобный формат работы: гибрид или офис * ежегодный пересмотр зарплаты, годовая премия * корпоративный спортзал и зоны отдыха * более 400 образовательных программ СберУниверситета для профессионального и карьерного развития * расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа * ипотека выгоднее до 7% для каждого сотрудника * бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров * вознаграждение за рекомендацию друзей в команду Сбера.

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available