ML-аналитик в Мою Память Алисы
У нас небольшая команда и заметная зона ответственности. Мы ведём полный цикл работы с ML. Результат работы становится частью Алисы на разных устройствах. Если вам интересно измерять качество сложных AI-систем, разбираться в поведении LLM и делать Алису полезнее в ежедневных задачах — откликайтесь.Создание системы оценки качества AI-продукта
Вы будете формировать целостную картину качества сценария: определять ключевые метрики и раскладывать их по этапам — роутинг, поиск контекста, вызов инструментов, итоговый ответ и доставка результата. Нужно будет связывать офлайн-оценку моделей с поведением продукта в реальном потоке, проектировать мониторинги и дашборды, которые помогают вовремя замечать деградации. Предстоит находить срезы, в которых общая метрика скрывает проблемы: разные устройства, интенты, типы записей и сложность диалога. Приёмка новых моделей и изменений
Вместе с ML-разработчиками, продуктом и редакторами вы будете отвечать на практический вопрос: можно ли выпускать новую модель пользователям? Для этого предстоит: собирать репрезентативные eval-наборы и приёмочные корзинки, сравнивать версии моделей и разбирать регрессии, развивать LLM-as-a-judge и проверять его согласованность с человеческой оценкой. Нужно будет определять критерии готовности к эксперименту и запуску, проводить постанализ после выкладки и проверять, подтвердился ли ожидаемый эффект. Разбор ошибок модели и поиск точек роста
Вам предстоит много работать с живыми пользовательскими сценариями и текстовыми логами. Ваши задачи — искать срабатывания false positive и false negative; разбирать DSAT и проблемные диалоги; кластеризовать ошибки и отделять проблемы намерения, retrieval, tool calling и генерации ответа. Нужно будет выявлять повторяющиеся паттерны через data mining и эвристики, превращать наблюдения в проверяемые продуктовые и ML-гипотезы, оценивать масштаб проблемы и ожидаемый эффект исправления. Подготовка данных для улучшения моделей и проверка изменений онлайн
Вы будете участвовать во всём цикле улучшения качества: формировать выборки для обучения, валидации и независимой приёмки; следить за покрытием сценариев и смещениями в данных; помогать определять разметку и таксономию ошибок. Нужно будет оценивать качество датасетов и автоматической разметки, делать воспроизводимые исследования, которыми сможет пользоваться вся команда. После офлайн-приёмки предстоит оценивать работу продукта на реальных пользователях: проектировать и анализировать A/B-эксперименты, интерпретировать изменения продуктовых и качественных метрик, отделять эффект модели от изменений состава трафика, находить новые проблемы и удачные сценарии, которые проявляются только в живом потоке.* Уверенно владеете SQL и Python и умеете самостоятельно проводить исследование от сырых данных до вывода * Умеете работать с большими объёмами событийных данных и текстовых логов * Знаете основы математической статистики и A/B-тестирования * Умеете проектировать метрики, проверять их валидность и объяснять ограничения * Способны превратить размытый вопрос о качестве продукта в измеримую постановку * Умеете находить причины за агрегатами и проверять гипотезы на данных * Понимаете базовые принципы работы ML-моделей и готовы разбираться в сложной LLM-системе * Ясно формулируете выводы и можете обсуждать их с ML-разработчиками, инженерами, редакторами и менеджерами* Работали с LLM-продуктами, NLP или голосовыми ассистентами * Строили evals, LLM-as-a-judge или системы автоматической оценки моделей * Оценивали качество ранжирования, поиска или классификации * Собирали обучающие и приёмочные датасеты * Строили аналитические дашборды и мониторинги * Знакомы с retrieval, RAG, tool calling и агентными системами * Умеете работать с неструктурированными данными и проектировать таксономии ошибок
Вы будете формировать целостную картину качества сценария: определять ключевые метрики и раскладывать их по этапам — роутинг, поиск контекста, вызов инструментов, итоговый ответ и доставка результата. Нужно будет связывать офлайн-оценку моделей с поведением продукта в реальном потоке, проектировать мониторинги и дашборды, которые помогают вовремя замечать деградации. Предстоит находить срезы, в которых общая метрика скрывает проблемы: разные устройства, интенты, типы записей и сложность диалога. Приёмка новых моделей и изменений
Вместе с ML-разработчиками, продуктом и редакторами вы будете отвечать на практический вопрос: можно ли выпускать новую модель пользователям? Для этого предстоит: собирать репрезентативные eval-наборы и приёмочные корзинки, сравнивать версии моделей и разбирать регрессии, развивать LLM-as-a-judge и проверять его согласованность с человеческой оценкой. Нужно будет определять критерии готовности к эксперименту и запуску, проводить постанализ после выкладки и проверять, подтвердился ли ожидаемый эффект. Разбор ошибок модели и поиск точек роста
Вам предстоит много работать с живыми пользовательскими сценариями и текстовыми логами. Ваши задачи — искать срабатывания false positive и false negative; разбирать DSAT и проблемные диалоги; кластеризовать ошибки и отделять проблемы намерения, retrieval, tool calling и генерации ответа. Нужно будет выявлять повторяющиеся паттерны через data mining и эвристики, превращать наблюдения в проверяемые продуктовые и ML-гипотезы, оценивать масштаб проблемы и ожидаемый эффект исправления. Подготовка данных для улучшения моделей и проверка изменений онлайн
Вы будете участвовать во всём цикле улучшения качества: формировать выборки для обучения, валидации и независимой приёмки; следить за покрытием сценариев и смещениями в данных; помогать определять разметку и таксономию ошибок. Нужно будет оценивать качество датасетов и автоматической разметки, делать воспроизводимые исследования, которыми сможет пользоваться вся команда. После офлайн-приёмки предстоит оценивать работу продукта на реальных пользователях: проектировать и анализировать A/B-эксперименты, интерпретировать изменения продуктовых и качественных метрик, отделять эффект модели от изменений состава трафика, находить новые проблемы и удачные сценарии, которые проявляются только в живом потоке.* Уверенно владеете SQL и Python и умеете самостоятельно проводить исследование от сырых данных до вывода * Умеете работать с большими объёмами событийных данных и текстовых логов * Знаете основы математической статистики и A/B-тестирования * Умеете проектировать метрики, проверять их валидность и объяснять ограничения * Способны превратить размытый вопрос о качестве продукта в измеримую постановку * Умеете находить причины за агрегатами и проверять гипотезы на данных * Понимаете базовые принципы работы ML-моделей и готовы разбираться в сложной LLM-системе * Ясно формулируете выводы и можете обсуждать их с ML-разработчиками, инженерами, редакторами и менеджерами* Работали с LLM-продуктами, NLP или голосовыми ассистентами * Строили evals, LLM-as-a-judge или системы автоматической оценки моделей * Оценивали качество ранжирования, поиска или классификации * Собирали обучающие и приёмочные датасеты * Строили аналитические дашборды и мониторинги * Знакомы с retrieval, RAG, tool calling и агентными системами * Умеете работать с неструктурированными данными и проектировать таксономии ошибок