ML‑разработчик в команду ядра детекции (Автономный транспорт)
Summary
ML engineer leading 3D occupancy prediction for autonomous-vehicle perception, designing transformer-based models, optimizing realtime inference, and unifying multi-modal sensor heads.
Команда Detector Alignment отвечает за то, чтобы автомобиль правильно «видел» и понимал окружающую среду. В нашем стеке восприятия много похожих компонентов. Мы хотим объединить их в 3D Occupancy Grid, и нам нужен специалист, который возглавит работу: от создания PoC до внедрения продакшен‑модели.Анализ методов 3D Occupancy Prediction
Вы будете изучать современные методы прогнозирования occupancy в 3D: и на основе данных с камеры (camera-only), и с объединением данных камеры и лидара (camera-lidar fusion). Нужно оценить, насколько эти методы подходят для нашей сенсорной конфигурации и вычислительного бюджета, а также обосновать, какую архитектуру стоит выбрать. Интеграция 3D OG
Нужно спроектировать работу occupancy в трансформерной модели: разобраться в устройстве voxel/occupancy queries, понять, как функционирует cross-attention с признаками камер и лидара, выяснить, как задача разделяет бэкбон с детекцией и другими головами, а также найти способы избежать негативного transfer между задачами. Анализ пайплайна и работа с датасетом
Вы будете разбирать текущий пайплайн генерации псевдоразметки для статических и динамических объектов: поймёте, как он работает, какие у него ограничения и где есть возможности для развития. Также соберёте датасет карт занятости и создадите стабильный пайплайн, который позволит регулярно пополнять датасет. Обучение модели
Вы будете реализовывать и обучать модель, которая предсказывает 3D OG. Нужно продумать, как оценивать её работу: использовать метрики precision, recall, F1, IoU (по классам и по дальностным зонам), проанализировать предсказания визуально, а также честно сравнить разные подходы между собой и с текущими решениями. Унификация голов восприятия
Вы будете постепенно заменять разные типы голов — OG, AG, height grids, лидарную сегментацию — единым представлением в виде voxel grid. При этом важно сохранить качество работы в критичных сценариях. Оптимизация latency
Вы будете оценивать и оптимизировать стоимость инференса в рамках текущего бюджета, работать с realtime‑ограничениями на целевом оборудовании и доводить модель до стабильной работы на автомобиле. Улучшение детекции
Вы будете итеративно повышать качество детекции: работать с лоссами и семплированием, применять аугментации и self-/semi-supervised-подходы, использовать дистилляцию, анализировать ошибки и работать с длинным хвостом сценариев. Alignment и устойчивость
Вы будете обеспечивать, чтобы модели хорошо работали в разной погоде и освещённости, на различных сенсорных конфигурациях и в новых географических зонах. Также вам предстоит разрабатывать алгоритмы, которые определят, при каких условиях можно эксплуатировать систему (например, учитывать погоду, состояние дороги и деградацию сенсоров). Больше об ML в Яндексе — в канале Yandex for ML* Уверенно обучаете нейросетевые модели и владеете PyTorch (или TensorFlow) и фреймворками поверх * Ориентируетесь в прикладном DL и компьютерном зрении: знаете теорию, но измеряете себя практическим результатом * Понимаете, как устроены трансформеры и attention изнутри — не только умеете их запускать, но и можете осознанно менять архитектуру * Умеете работать с 3D‑представлениями: BEV, voxel grids, проективная геометрия, калибровки, работа с облаками точек * Способны самостоятельно вести исследовательскую задачу: от обзора литературы и постановки метрик до понятных выводов * Понимаете особенности realtime‑ограничений и умеете думать о latency на этапе выбора архитектуры * Стремитесь использовать и распространять универсальные, масштабируемые практики * Читаете статьи с ML‑конференций и следите за развитием области* Работали с query-based архитектурами восприятия: DETR-подобные детекторы, Deformable DETR, BEVFormer, StreamPETR, Mask2Former и аналоги * Работали с occupancy prediction или BEV-перцепцией (LSS, BEVFusion, TPVFormer, SurroundOcc, VoxFormer, FB-OCC и т. п.) * Работали с мультимодальными моделями (камера + лидар + радар) и sensor fusion * Обучали multi-task-модели с общим бэкбоном и умеете балансировать задачи между собой * Строили пайплайны автоматической разметки и псевдоразметки, работали с накоплением сцен и SLAM-выходами * Имели дело с большими моделями (LLM, VLM, Foundation Models) в иных доменах * Оптимизировали инференс под целевое железо: TensorRT, квантизация, sparse convolutions, оптимизация attention * Выполняли задачи автономного транспорта
Вы будете изучать современные методы прогнозирования occupancy в 3D: и на основе данных с камеры (camera-only), и с объединением данных камеры и лидара (camera-lidar fusion). Нужно оценить, насколько эти методы подходят для нашей сенсорной конфигурации и вычислительного бюджета, а также обосновать, какую архитектуру стоит выбрать. Интеграция 3D OG
Нужно спроектировать работу occupancy в трансформерной модели: разобраться в устройстве voxel/occupancy queries, понять, как функционирует cross-attention с признаками камер и лидара, выяснить, как задача разделяет бэкбон с детекцией и другими головами, а также найти способы избежать негативного transfer между задачами. Анализ пайплайна и работа с датасетом
Вы будете разбирать текущий пайплайн генерации псевдоразметки для статических и динамических объектов: поймёте, как он работает, какие у него ограничения и где есть возможности для развития. Также соберёте датасет карт занятости и создадите стабильный пайплайн, который позволит регулярно пополнять датасет. Обучение модели
Вы будете реализовывать и обучать модель, которая предсказывает 3D OG. Нужно продумать, как оценивать её работу: использовать метрики precision, recall, F1, IoU (по классам и по дальностным зонам), проанализировать предсказания визуально, а также честно сравнить разные подходы между собой и с текущими решениями. Унификация голов восприятия
Вы будете постепенно заменять разные типы голов — OG, AG, height grids, лидарную сегментацию — единым представлением в виде voxel grid. При этом важно сохранить качество работы в критичных сценариях. Оптимизация latency
Вы будете оценивать и оптимизировать стоимость инференса в рамках текущего бюджета, работать с realtime‑ограничениями на целевом оборудовании и доводить модель до стабильной работы на автомобиле. Улучшение детекции
Вы будете итеративно повышать качество детекции: работать с лоссами и семплированием, применять аугментации и self-/semi-supervised-подходы, использовать дистилляцию, анализировать ошибки и работать с длинным хвостом сценариев. Alignment и устойчивость
Вы будете обеспечивать, чтобы модели хорошо работали в разной погоде и освещённости, на различных сенсорных конфигурациях и в новых географических зонах. Также вам предстоит разрабатывать алгоритмы, которые определят, при каких условиях можно эксплуатировать систему (например, учитывать погоду, состояние дороги и деградацию сенсоров). Больше об ML в Яндексе — в канале Yandex for ML* Уверенно обучаете нейросетевые модели и владеете PyTorch (или TensorFlow) и фреймворками поверх * Ориентируетесь в прикладном DL и компьютерном зрении: знаете теорию, но измеряете себя практическим результатом * Понимаете, как устроены трансформеры и attention изнутри — не только умеете их запускать, но и можете осознанно менять архитектуру * Умеете работать с 3D‑представлениями: BEV, voxel grids, проективная геометрия, калибровки, работа с облаками точек * Способны самостоятельно вести исследовательскую задачу: от обзора литературы и постановки метрик до понятных выводов * Понимаете особенности realtime‑ограничений и умеете думать о latency на этапе выбора архитектуры * Стремитесь использовать и распространять универсальные, масштабируемые практики * Читаете статьи с ML‑конференций и следите за развитием области* Работали с query-based архитектурами восприятия: DETR-подобные детекторы, Deformable DETR, BEVFormer, StreamPETR, Mask2Former и аналоги * Работали с occupancy prediction или BEV-перцепцией (LSS, BEVFusion, TPVFormer, SurroundOcc, VoxFormer, FB-OCC и т. п.) * Работали с мультимодальными моделями (камера + лидар + радар) и sensor fusion * Обучали multi-task-модели с общим бэкбоном и умеете балансировать задачи между собой * Строили пайплайны автоматической разметки и псевдоразметки, работали с накоплением сцен и SLAM-выходами * Имели дело с большими моделями (LLM, VLM, Foundation Models) в иных доменах * Оптимизировали инференс под целевое железо: TensorRT, квантизация, sparse convolutions, оптимизация attention * Выполняли задачи автономного транспорта