freehire launches on Product Hunt on 26 August.

Follow →

Аналитик-разработчик в команду разметки и анализа данных Фантеха

Summary

Builds automated data labeling pipelines and evaluates datasets for Yandex’s entertainment services (Music, Movies, Books) to improve AI recommendations by tagging content attributes (e.g., artist status, clip type, child-friendly ratings).

Наша команда занимается добычей, систематизацией и улучшением существующих датасетов для всего отдела ML в развлекательных сервисах: Яндекс Музыка, Кинопоиск, Яндекс Книги и других. Ищем аналитика, который поможет нам добывать новые данные, а также систематизировать и улучшать текущие базы данных.Строить и улучшать автоматические процессы разметки данных
Разметка будет содержательно описывать сущности, которые могут быть рекомендованы пользователю или показаны в продукте. На каком языке этот трек? Жив ли этот музыкальный исполнитель? Этот музыкальный клип — студийный, или это запись концерта? Можно ли включить этот сериал ребёнку? Какая книга является наилучшим ответом на этот поисковый запрос? На все эти и многие другие вопросы будет отвечать разметка, за которой будете стоять вы. Оценивать качество размеченных датасетов
Нередко получается так, что наша команда получает готовую разметку на десятки миллионов единиц контента: от правообладателей, внешнего мира, других команд и т. д. Вам нужно будет ответить, хороша ли эта разметка. Какие у неё проблемные места? Лучше ли она уже существующей? Можем ли мы сделать её лучше? Находить полезные данные за пределами Фантеха
Бывают случаи, когда нужных данных нет, а процесс их разметки строить намного дороже, нежели найти их где-то ещё. Вам предстоит выяснить, есть ли эти данные внутри Яндекса. Или, может быть, они есть в интернете? Как сопоставить эти данные с сущностями из базы данных Музыки/Кинопоиска/Книг? Больше об аналитике в Яндексе — в канале Yandex for Analytics* Хорошо владеете теорией вероятностей и математической статистикой * Можете делать выводы на основе данных * Умеете программировать на Python и SQL * Понимаете, как работает интернет* Работали с распределёнными системами хранения и обработки данных MapReduce * Имеете опыт работы с ML * Писали парсеры * Работали с платформами для краудсорсинга: Label Studio, Toloka, Amazon Mechanical Turk и т. д.

See also