Лид направления long-horizon-агентности Alice AI LLM
Вы будете развивать внешние и внутренние бенчмарки, в том числе Terminal и SkillsBench. Вам предстоит разработать стратегию и план, которые помогут развивать систему оценки long-horizon-возможностей моделей, а также сформулировать требования к эталонным решениям и автоматическим верификаторам. Анализ работы агентов
Нужно будет анализировать результаты и траектории работы агентов, выявлять системные ограничения и возможности для роста. Вместе с командами разработки и обучения вы будете устранять основные классы ошибок и добиваться измеримого улучшения моделей. Подготовка обучающих данных
Одна из ваших задач — проектировать пайплайны, которые генерируют, размечают и проверяют обучающие данные. Управление командой
Вам предстоит нанимать и развивать сотрудников, выстраивать процессы и распределять зоны ответственности в команде. Больше об аналитике в Яндексе — в канале Yandex for Analytics* Руководили технической командой или были ведущим специалистом * Работали в сфере NLP * Активно пользуетесь инструментами для вайб‑кодинга, в идеале можете объяснить разницу между Claude и Codex * Уверенно владеете SQL и Python * Анализируете данные и строите эффективные процессы их обработки * Знаете теорию вероятностей и математическую статистику * Интересуетесь развитием LLM и понимаете, как устроены агентские системы * Самостоятельны и готовы работать с задачами, для которых ещё нет готового решения* Работали с метриками и бенчмарками в NLP * Строили или оценивали агентские системы * Свободно читаете статьи и документацию на английском языке