Team Lead в команду ML-инфраструктуры R&D
Summary
Leads a team building and optimizing infrastructure for training and fine-tuning large language and vision-language models, focusing on RL training, diagnostics, and fault tolerance using Python, PyTorch, and distributed computing.
Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLM) моделей. Ищем тимлида, который будет оптимизировать инфраструктуру RL-обучения и развивать инструменты диагностики. Ждём, что вы знаете Python и работали с фреймворком PyTorch.Оптимизация инфраструктуры RL-обучения
Вы будете улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, а также коммуникации между блоками обучения; повышать эффективность работы внутри блоков. Развитие инструментов диагностики
Вы будете создавать и улучшать инструменты, чтобы быстро находить и решать инфраструктурные проблемы. Обеспечение отказоустойчивости инфраструктуры
Вы будете реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к разным ошибкам и сбоям. Исследование решений
Вы будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать, насколько они эффективны, и внедрять их в реальные проекты. Больше об ML в Яндексе — в канале Yandex for ML* Знаете Python и работали в системном программировании, разработке библиотек или фреймворков * Умеете работать с фреймворком PyTorch и распределённым обучением через torch.distributed * Владеете подходами параллелизации: понимаете Data Parallelism, Tensor Parallelism, Pipeline Parallelism, Expert Parallelism для распределённого инференса или обучения * Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшене * Можете эффективно работать в команде и делиться знаниями* Участвовали в создании инфраструктуры обучения ML-моделей * Внедряли и оптимизировали RL-решения * Использовали библиотеки RL-обучения для LLM (veRL, slime, NeMo-RL, SkyRL) и библиотеки инференса (vLLM, SGLang и TRT-LLM) * Работали с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton * Владеете C++ и работали с низкоуровневым программированием и оптимизацией
Вы будете улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, а также коммуникации между блоками обучения; повышать эффективность работы внутри блоков. Развитие инструментов диагностики
Вы будете создавать и улучшать инструменты, чтобы быстро находить и решать инфраструктурные проблемы. Обеспечение отказоустойчивости инфраструктуры
Вы будете реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к разным ошибкам и сбоям. Исследование решений
Вы будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать, насколько они эффективны, и внедрять их в реальные проекты. Больше об ML в Яндексе — в канале Yandex for ML* Знаете Python и работали в системном программировании, разработке библиотек или фреймворков * Умеете работать с фреймворком PyTorch и распределённым обучением через torch.distributed * Владеете подходами параллелизации: понимаете Data Parallelism, Tensor Parallelism, Pipeline Parallelism, Expert Parallelism для распределённого инференса или обучения * Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшене * Можете эффективно работать в команде и делиться знаниями* Участвовали в создании инфраструктуры обучения ML-моделей * Внедряли и оптимизировали RL-решения * Использовали библиотеки RL-обучения для LLM (veRL, slime, NeMo-RL, SkyRL) и библиотеки инференса (vLLM, SGLang и TRT-LLM) * Работали с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton * Владеете C++ и работали с низкоуровневым программированием и оптимизацией