Аналитик-разработчик в команду оценки достоверности Алисы AI
Summary
Build and refine golden datasets, benchmarks, and instructions to evaluate the factual accuracy of LLM responses in Yandex’s Alice AI, while improving agent-based and human-based annotation pipelines using Python, SQL, and ML fundamentals.
Это ключевая область — можно сказать, сердце разметки. В ней четыре больших задачи: 1. Собирать эталоны и узкие бенчи (например, сложная корзинка) для оценки качества исполнителей и агентов. 2. Валидировать инструкцию на противоречия и вносить в неё правки, обсуждать с редакторами правки и изменения. 3. Размечать ответы для новых направлений. (Например, ответы с файлами на входе — как проверять в случае противоречий в файле и интернете? Как относиться к пропускам информации? А к креативу на фактических данных? — и т. д., всегда много вопросов.) 4. Отвечать за качество голденсета — то есть на вопрос «почему мы можем верить, что наш голденсет собран достаточно хорошо?» Исполнители-агенты
Новое направление, много низко висящих фруктов. В нём находятся задачи, связанные с развитием нашего основного агента-фактчекера, и создание новых дополнительных пайплайнов с LLM (например, для сбора голденсетов). Задачи направления: * Развивать имеющегося агента: довести f1 агента на критах до уровня редактора, сделать прокачку дешёвой. * Собрать набор агентов, которые с высокой полнотой и приемлемой точностью будут готовить разметку. Исполнители-люди
Классическая работа с асессорами и редакторами для роста качества разметки и достижения нужной производительности. С учётом текущих реалий тут также важно выстраивать пайплайны с LLM: * Подготовка хинтов (чтобы помогать исполнителям улучшать качество разметки). * Оценка качества комментариев. * Раздебаг проблем и обучение людей (найти проблему и срез людей, у которых она наблюдается). * Система оплаты и мотивации. * Аналитические: строим рейтинг исполнителей (развиваем подход, например модель Брэдли — Терри или микротюнинг текущего алгоритма), придумываем, как оценивать сложность заданий, а позже — как подбирать под задание группу исполнителей. Больше об аналитике в Яндексе — в канале Yandex for Analytics* Понимаете, почему важно всегда смотреть в данные * Уверенно пишете на Python и знаете алгоритмы * Знаете математическую статистику и проверяли гипотезы с её помощью* Интересуетесь продуктом, стремитесь понять, каким он должен быть и почему * Умеете общаться, ясно излагать мысли, понимать и учитывать мнение коллег, убеждать * Работали с табличными данными на SQL * Имели дело с крауд-проектами, например делали разметку в Толоке * Знаете основы машинного обучения