Point your AI agent at freehire and let it find you a job.

Get the CLI →

ПАО Сбербанк

Open 49d

Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat

Posted
Discussion

Summary

Senior engineer optimizes and accelerates the rollout stage of an online RL pipeline for GigaChat, focusing on LLM inference efficiency, GPU utilization, and system integration.

Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели. Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат.* разрабатывать и улучшать методы online RL * реализовывать и дорабатывать подходы post-training и online RL * проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин * разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач * следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру * строить и развивать инфраструктуру обучения * разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели * обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций * оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест * выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять * работать с данными и системой оценки качества * участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки * строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек * анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения * тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры * брать на себя ответственность за целые куски системы: от идеи до результата в проде * делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества. ** отличное владение Python и PyTorch * практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях * опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы * понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги. * Умение писать чистый, надёжный, production-ready код * способность разбираться в сложных системах и самостоятельно находить и устранять узкие места.* возможность выбрать удобный формат работы: гибрид или офис * ежегодный пересмотр зарплаты, годовая премия * корпоративный спортзал и зоны отдыха * более 400 образовательных программ СберУниверситета для профессионального и карьерного развития * расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа * ипотека выгоднее до 7% для каждого сотрудника * бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров * вознаграждение за рекомендацию друзей в команду Сбера.

Skills

See also

AI Engineering jobs by country — openings, pay and top skills →

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available