Summary
Data Analyst in Sberbank's Robotics Center, working with large datasets used to train robot-control models: detecting data anomalies, supporting filtering/validation and data-acceptance pipelines, tracking collection and labeling statistics, and building dashboards. Core stack: Python (pandas/polars, numpy), SQL, git, math statistics.
В Центре робототехники Сбера мы собираем большие объёмы данных для обучения моделей управления роботами в сложных реальных условиях. Важно не только наращивать объём датасетов, но и понимать их состав, качество и динамику сбора, своевременно выявлять проблемы и улучшать процессы работы с данными. Мы ищем Data Analyst, который будет развивать аналитику и контроль качества датасетов: выявлять аномалии, сопровождать пайплайны фильтрации и приёмки данных, вести статистику сбора, строить дэшборды, а также формировать рекомендации для команд сбора и разметки.
Первый этап отбора на эту вакансию — общение с AI-рекрутером. После отклика ждите сообщение от него, диалог займёт примерно 10 минут. Задача AI-рекрутера — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. AI-рекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным для всех!* выявлять аномалии, несоответствия и другие проблемы в данных
* разрабатывать и развивать автоматические и полуавтоматические проверки качества данных
* участвовать в развитии пайплайнов фильтрации, валидации и приёмки данных
* строить дэшборды, визуализации и регулярную статистику по сбору, разметке, качеству и составу датасетов
* готовить отчёты по результатам проверок качества и анализу датасетов
* формировать рекомендации по улучшению сбора, разметки, фильтрации и приоритизации данных.* 2+ года опыта в data analysis, data engineering, applied ML или близкой области
* уверенное владение Python: pandas/polars, numpy, visualization
* знание математической статистики и умение корректно интерпретировать результаты анализа
* умение анализировать мультимодальные данные: видео, временные ряды, текстовые данные
* умение писать поддерживаемый воспроизводимый код, работа с git
* знание SQL и опыт работы с таблицами, метаданными
* базовое понимание ML и жизненного цикла данных для обучения моделей
* хорошая письменная коммуникация для отчетов и постановки задач смежным командам
* проактивность и способность доводить наблюдение в данных до конкретного улучшения процесса.
Будет плюсом:
* опыт с annotation QA, data curation, anomaly detection или quality scoring
* опыт обучения ML/DL моделей
* опыт работы с большими датасетами и распределёнными системами
* опыт автоматизации регулярной обработки данных
* навыки работы с генеративными AI-моделями
* опыт создания AI-агентов и использования их в работе будет преимуществом
* опыт использования GigaChat, Kandinsky и аналогов в продуктах, навыки создания и использования AI-агентов
* инструментальное владение AI для анализа, генерации и автоматизации.* офисный формат работы, адрес офиса Автозаводская 23а к2
* ежегодный пересмотр зарплаты, квартальная и годовая премия
* корпоративный спортзал и зоны отдыха
* более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
* программа адаптации и помощь руководителя на старте
* расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
* гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
* подписка Прайм с возможностью совместного использования на трёх близких
* вознаграждение за рекомендацию друзей в команду Сбера.