Аналитик-разработчик в службу AI-оптимизации
Summary
Analyst-developer on Yandex Search's AI-optimization team: replaces manual data labeling with AI agents/LLMs, builds benchmarks to validate LLM-as-a-judge quality, and studies how signal changes affect search ranking through offline metrics and online A/B experiments. Core stack: SQL, Python (pandas, NumPy), ML quality metrics, experiment design.
Вам предстоит разрабатывать подходы к замещению труда разметчиков AI-агентами и LLM. Необходимо не просто внедрить автоматизацию, а доказать, что качество сигнала при этом не ухудшилось (или улучшилось). Это требует создания сложных бенчмарков и методик валидации. Оценка качества LLM-as-a-judge
Мы активно используем большие языковые модели как «судью» для оценки релевантности. Ваша задача — придумать, как объективно измерить качество самой LLM в этой роли, выявить её системные ошибки (биасы) и калибровать её выводы для задач ранжирования. Исследование влияния изменений на ранжирование
Работа с поисковыми сигналами требует понимания казуальности: как изменения в разметке или сигнале трансформируют финальное ранжирование. Вы будете проектировать дизайн экспериментов (офлайн и онлайн), строить срезы данных и находить скрытые проблемы, которые могут повлиять на пользовательский опыт. Подготовка и проведение онлайн-экспериментов
Через несколько месяцев фокус сместится на запуск A/B-тестов в реальном поисковом трафике. Вам предстоит определять, в каких срезах и аспектах ранжирования возникают проблемы, и предлагать инженерные способы их починки на основе данных эксперимента. Больше об аналитике в Яндексе — в канале Yandex for Analytics* Имеете опыт на стыке аналитики и разработки: уверенно работаете с SQL и Python (pandas, NumPy), умеете не только извлекать данные, но и строить на их основе сложные модели оценки: офлайн-метрики, статистические выводы * Понимаете принципы машинного обучения: знаете, как устроены метрики качества ML-моделей (precision, recall, ndcg), имели опыт с LLM или понимаете их специфику: промпт-инжиниринг, оценку качества генерации * Умеете выстраивать эксперименты: знаете, как обеспечить статистическую значимость выводов, работали с A/B-тестированием или офлайн-симуляциями * Склонны к методологической работе: вам интересно не просто посчитать цифру, а придумать способ измерения там, где готового инструмента нет, и защитить свой подход перед стейкхолдерами * Обладаете критическим мышлением: умеете декомпозировать сложные проблемы поискового ранжирования на измеримые компоненты