Аналитик-разработчик в команду разметки и анализа данных Фантеха
Summary
Builds automated data labeling pipelines and evaluates datasets for Yandex’s entertainment services (Music, Movies, Books) to improve AI recommendations by tagging content attributes (e.g., artist status, clip type, child-friendly ratings).
Разметка будет содержательно описывать сущности, которые могут быть рекомендованы пользователю или показаны в продукте. На каком языке этот трек? Жив ли этот музыкальный исполнитель? Этот музыкальный клип — студийный, или это запись концерта? Можно ли включить этот сериал ребёнку? Какая книга является наилучшим ответом на этот поисковый запрос? На все эти и многие другие вопросы будет отвечать разметка, за которой будете стоять вы. Оценивать качество размеченных датасетов
Нередко получается так, что наша команда получает готовую разметку на десятки миллионов единиц контента: от правообладателей, внешнего мира, других команд и т. д. Вам нужно будет ответить, хороша ли эта разметка. Какие у неё проблемные места? Лучше ли она уже существующей? Можем ли мы сделать её лучше? Находить полезные данные за пределами Фантеха
Бывают случаи, когда нужных данных нет, а процесс их разметки строить намного дороже, нежели найти их где-то ещё. Вам предстоит выяснить, есть ли эти данные внутри Яндекса. Или, может быть, они есть в интернете? Как сопоставить эти данные с сущностями из базы данных Музыки/Кинопоиска/Книг? Больше об аналитике в Яндексе — в канале Yandex for Analytics* Хорошо владеете теорией вероятностей и математической статистикой * Можете делать выводы на основе данных * Умеете программировать на Python и SQL * Понимаете, как работает интернет* Работали с распределёнными системами хранения и обработки данных MapReduce * Имеете опыт работы с ML * Писали парсеры * Работали с платформами для краудсорсинга: Label Studio, Toloka, Amazon Mechanical Turk и т. д.