Data Scientist в Лавку (геоаналитика)
Summary
Build and deploy ML models to forecast demand and optimize dark-store placement for Yandex Lavka using geodata, demographics, and logistics.
Вы будете разрабатывать и обучать модели, чтобы прогнозировать спрос в разных районах и городах. Нужно создавать решения, которые оценят потенциал новых территорий — с учётом геоданных, демографии, логистики и других факторов. Также предстоит адаптировать уже существующие модели под новые регионы и сценарии, чтобы они оставались актуальными и полезными в меняющихся условиях. Ваша работа поможет получить надёжные ML‑решения: они напрямую повлияют на бизнес‑результаты — позволят точнее прогнозировать спрос, эффективнее распределять ресурсы и выбирать приоритетные зоны для развития сети. Обработка геоданных для ML
Вы будете готовить и обрабатывать пространственные данные — полигоны доставки, H3‑сетки, зоны доступности, — чтобы использовать их в моделях машинного обучения. Важная часть работы — заниматься feature engineering: извлекать и создавать признаки на основе геоданных, демографических показателей и операционных метрик. Также вам предстоит интегрировать геоданные в ML‑пайплайны: обеспечивать правильную подачу информации в модели и согласованность форматов данных. Цель работы — сформировать качественную входную базу для моделей. Это позволит повысить точность прогнозов и улучшить качество решений. Оптимизация моделей
Вы будете регулярно следить за качеством и актуальностью ML‑моделей: оценивать, насколько хорошо они работают с текущими данными, при необходимости переобучать или дорабатывать алгоритмы. Нужно будет тестировать разные версии моделей, сравнивать их и смотреть, как они влияют на ключевые бизнес‑метрики. Также предстоит оптимизировать модели: улучшать скорость и точность предсказаний, чтобы модели оставались эффективными, даже если условия изменятся или сервис будет масштабироваться. Главная цель — надолго сохранить высокую точность и надёжность моделей. Техническая реализация ML‑пайплайнов
Вы будете писать чистый и воспроизводимый код на Python — от сбора данных до финального прогноза. Ваша задача — автоматизировать сбор данных, обучение и развёртывание моделей, чтобы уменьшить ручную работу и сделать решения более стабильными. Вам также предстоит сотрудничать с инженерами данных и аналитиками: настраивать конвейеры данных, передавать результаты моделей в бизнес‑системы и контролировать работу всего стека. Цель — вывести разработанные модели из стадии прототипов и начать реально использовать их в работе компании. Поддержка ML‑решений
Вы будете помогать команде геоаналитиков работать с моделями машинного обучения: объяснять, как работают предсказания, выявлять главные факторы влияния и показывать практическую пользу результатов. Вам предстоит готовить техническую документацию и отчёты: описывать архитектуру моделей, их метрики качества и давать рекомендации по применению. Также нужно будет консультировать коллег по работе с ML‑решениями и помогать подстраивать модели под бизнес‑задачи. Ваша работа обеспечит эффективное использование ML‑инструментов — благодаря этому модели помогут принимать обоснованные решения по развитию географии Яндекс Лавки. Больше об аналитике в Яндексе — в канале Yandex for Analytics* Владеете Python и SQL * Работали над построением и внедрением ML‑моделей * Понимаете основы математической статистики и теории вероятностей * Умеете работать с большими объёмами данных и строить воспроизводимые пайплайны * Способны быстро осваивать новые инструменты и подходы в ML * Внимательны к деталям, аккуратны в коде и расчётах * Обладаете хорошими коммуникативными навыками для взаимодействия с командой* Работали с геоданными или геопакетами (GeoPandas, Shapely, H3, PostGIS и т. п.) * Решали задачи прогнозирования спроса, кластеризации территорий или оптимизации размещения объектов * Знаете основы логистики или операционной аналитики