Разработчик в группу разработки ML-инфраструктуры YT
Мы разрабатываем единую библиотеку распределённых обучений, которая будет интегрирована со всем спектром систем запуска обучений, анализа логов, профилирования, мониторинга и др. Мы хотим сократить количество ручных действий и нестабильностей, чтобы быстрее двигаться вперёд. Автоматизация обнаружения и устранения ошибок распределённых обучений
Одна из важных проблем состоит в том, что в случае ошибки обучения бывает сложно определить точную причину: выход из строя одного из серверов, сбой сети при передаче данных или ошибка в пользовательском коде. Мы работаем над тем, чтобы автоматически обнаруживать ошибку и принимать решение о необходимости перезапуска обучения на другом оборудовании, а также рекомендовать пользователю способы исправления ошибки. Мониторинг, профилирование и оптимизация использования GPU
Различные сбои и неэффективности могут приводить к тому, что GPU простаивают. Мы разрабатываем инструменты, позволяющие обнаруживать и анализировать неэффективное использование GPU. Больше о бэкенде в Яндексе — в канале Yandex for Backend* Уверенно владеете Python, Go или C++ * Умеете и хотите разбираться в распределённых системах и нетривиальном коде * Способны быстро погружаться в новые задачи и находить оптимальные решения — даже в незнакомых областях и при меняющихся приоритетах* Готовы взаимодействовать с пользователями и помогать им диагностировать проблемы * Понимаете, как устроено ML-обучение