Разработчик инфраструктуры RL-обучения Alice AI LLM

Open 38d
Мы создаём инфраструктуру для обучения LLM и VLМ, которые используются в Алисе, Поиске, Рекламе и других сервисах Яндекса. Ищем разработчика, который будет оптимизировать инфраструктуру RL-обучения. Ждём, что вы знаете Python, PyTorch и разрабатывали распределённые системы.Оптимизация инфраструктуры RL-обучения
Вам предстоит улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, оптимизировать коммуникации между блоками обучения, повышать эффективность работы внутри блоков. Развитие инструментов диагностики
Вы будете создавать и совершенствовать инструменты, которые позволят быстро выявлять и устранять инфраструктурные проблемы. Повышение отказоустойчивости инфраструктуры
Предстоит реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к различным ошибкам и сбоям. Исследование и внедрение современных решений
Будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность и внедрять в реальные проекты. Больше о бэкенде в Яндексе — в канале Yandex for Backend* Знаете Python и имеете опыт системного программирования, разработки библиотек или фреймворков * Хорошо знакомы и работали на практике с фреймворком PyTorch и распределённым обучением через torch.distributed * Владеете подходами параллелизации: понимаете data parallelism, tensor parallelism, pipeline parallelism, expert parallelism для распределённого инференса или обучения * Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшне * Умеете эффективно работать в команде и делиться знаниями* Участвовали в создании инфраструктуры обучения ML-моделей * Внедряли и оптимизировали RL-решения * Работали с библиотеками RL-обучения для LLM: veRL, slime, NeMo-RL, SkyRL и другими, а также с библиотеками инференса: vLLM, SGLang и TRTLLM * Владеете C++ и имеете опыт низкоуровневого программирования и оптимизации * Имеете опыт с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton