freehire launches on Product Hunt on 26 August.

Follow →

Team Lead в команду ML-инфраструктуры R&D

Open 32d

Summary

Leads a team building and optimizing infrastructure for training and fine-tuning large language and vision-language models, focusing on RL training, diagnostics, and fault tolerance using Python, PyTorch, and distributed computing.

Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLM) моделей. Ищем тимлида, который будет оптимизировать инфраструктуру RL-обучения и развивать инструменты диагностики. Ждём, что вы знаете Python и работали с фреймворком PyTorch.Оптимизация инфраструктуры RL-обучения
Вы будете улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, а также коммуникации между блоками обучения; повышать эффективность работы внутри блоков. Развитие инструментов диагностики
Вы будете создавать и улучшать инструменты, чтобы быстро находить и решать инфраструктурные проблемы. Обеспечение отказоустойчивости инфраструктуры
Вы будете реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к разным ошибкам и сбоям. Исследование решений
Вы будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать, насколько они эффективны, и внедрять их в реальные проекты. Больше об ML в Яндексе — в канале Yandex for ML* Знаете Python и работали в системном программировании, разработке библиотек или фреймворков * Умеете работать с фреймворком PyTorch и распределённым обучением через torch.distributed * Владеете подходами параллелизации: понимаете Data Parallelism, Tensor Parallelism, Pipeline Parallelism, Expert Parallelism для распределённого инференса или обучения * Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшене * Можете эффективно работать в команде и делиться знаниями* Участвовали в создании инфраструктуры обучения ML-моделей * Внедряли и оптимизировали RL-решения * Использовали библиотеки RL-обучения для LLM (veRL, slime, NeMo-RL, SkyRL) и библиотеки инференса (vLLM, SGLang и TRT-LLM) * Работали с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton * Владеете C++ и работали с низкоуровневым программированием и оптимизацией

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available