freehire launches on Product Hunt on 26 August.

Follow →

Data Engineer в центр робототехники

Open 58d posting dated 2 weeks ago

Summary

Builds and maintains data pipelines that transform raw robot and external datasets into clean, versioned formats for AI/ML training in a robotics R&D center.

В Центре робототехники Сбера мы создаем роботов и системы ИИ, которым нужны большие и аккуратно подготовленные наборы данных. Data Conveyor Team отвечает за путь этих данных от сырых записей до формата, с которым могут работать ML-команды. Сейчас нам нужен Software Engineer, который будет превращать записи с роботов и внешние датасеты в понятный, проверяемый и воспроизводимый формат для обучения моделей. Первый этап отбора на эту вакансию — общение с AI-рекрутером. После отклика ждите сообщение от него, диалог займёт примерно 10 минут. Задача AI-рекрутера — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. AI-рекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным для всех!* проектировать и реализовывать пайплайны, которые превращают данные из разных источников в формат, пригодный для обучения моделей * стабилизировать основной путь конвертации данных с роботов: единый поддерживаемый процесс, проверяемые результаты, повторяемые запуски и понятные отчеты об ошибках * поддерживать dataset schema, versioning, compatibility checks, validators и manifests * подключать новые источники данных: записи с роботов, внешние датасеты, симуляции, egocentric data, данные тестовых запусков и корректирующих демонстраций * обеспечивать reproducible dataset builds и связь source data -> converted episodes -> filtered dataset -> dataset release -> training run -> benchmark result * создавать validation suite: проверка файлов, video/parquet layout, timestamps, required fields, metadata, annotation status и known historical variants * готовить данные к передаче в обучение так, чтобы ML-команды понимали состав датасета, ограничения, версию и качество * делать надежные CLI/tools, тесты, runbooks и отладочные отчеты для исследователей и инженеров.* сильный Python и опыт разработки batch / data processing pipelines * опыт backend, data engineering или software engineering для внутренних платформ и ML/data workflows * опыт работы с большими файлами, metadata manifests, reproducible builds и validation logic * практический опыт с Linux, Docker, Git, CI/CD и командной строкой * понимание storage и data formats: S3/object storage, network storage, parquet, zarr, hdf5, webdataset, video files или аналогичные форматы * умение разбираться в нестандартных форматах данных и приводить их к строгому контракту * готовность писать поддерживаемый production-like код, а не одноразовые conversion scripts. Будет плюсом: * опыт с LeRobot, RLDS, DROID / Bridge / RT-X-like datasets, ROS bags или robotics trajectories * опыт с Ray, Airflow, Prefect, Kubernetes, SLURM, LSF или другими orchestration / job systems * опыт с W&B, MLflow, Hydra configs, experiment tracking или dataset management systems * понимание computer vision, multimodal data, VLA, imitation learning или robot learning * навыки работы с генеративными AI-моделями * опыт создания AI-агентов и использования их в работе будет преимуществом * опыт использования GigaChat, Kandinsky и аналогов в продуктах, навыки создания и использования AI-агентов * инструментальное владение AI для анализа, генерации и автоматизации.* офисный формат работы, адрес офиса Автозаводская 23а к2 * ежегодный пересмотр зарплаты, квартальная и годовая премия * корпоративный спортзал и зоны отдыха * более 400 образовательных программ СберУниверситета для профессионального и карьерного развития * программа адаптации и помощь руководителя на старте * расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа * гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ * подписка Прайм с возможностью совместного использования на трёх близких * вознаграждение за рекомендацию друзей в команду Сбера.

See also