Стажёр Data Scientist (uplift & causal inference)
ПАО Сбербанк Стажёр Data Scientist (uplift & causal inference)
Мы команда Causal AI в блоке «Финансы» ПАО Сбербанк — развиваем решения в области uplift-моделирования, causal inference и сценарного анализа для задач клиентских коммуникаций и оценки эффектов. Нам интересны не только прикладные модели, но и корректная причинно-следственная интерпретация результатов: какие факторы действительно влияют на целевые переменные, как это экспериментально проверить и впоследствии использовать в принятии решений.
Сейчас мы ищем стажёра на задачи causal inference — оценка эффектов, поиск причинно-следственных связей и uplift-моделирование.
Наш стек: Python (scikit-learn, CatBoost, causal-learn, DoWhy, EconML, Hypex), Hadoop (PySpark, Hive, HDFS)* собирать и готовить данные, участвовать в сборке витрин
* проводить EDA и feature engineering, проверять качество и полноту данных
* обучать и валидировать ML-модели
* помогать в дизайне и анализе A/B-тестов: расчёт размера выборки, проверка корректности сплита, разбор результатов
* воспроизводить методы из статей и открытых библиотек, проводить сравнения с внутренними бейзлайнами на наших данных
* писать переиспользуемый код, тесты и документацию для нашей внутренней uplift-платформы
* поддерживать текущую аналитику: багфиксы моделей и ad hoc запросы от команды и заказчиков.* неоконченное высшее образование (находишься на последних курсах университета) по техническому направлению
* имеешь прочный математический фундамент, особенно в теории вероятностей и статистике (понимаешь смысл p-value и доверительного интервала, знаешь характеристики основных распределений)
* умеешь и любишь писать код на python, стараешься его оптимизировать, не боишься разбираться в чужом коде
* владеешь основными библиотеками для анализа данных (базовый минимум - pandas, numpy, sklearn)
* понимаешь, как устроены основные алгоритмы классического ML (линейные и древовидные модели)
* умеешь превратить расплывчатый вопрос в проверяемую гипотезу (например: у этой группы клиентов метрика выше – это эффект коммуникации или они и без неё были активнее?).
Будет плюсом
* читал про uplift-модели (T-learner, X-learner, DR-learner, IPW, PSM) и пробовал их хотя бы на учебных данных
* имеешь опыт с DoWhy, EconML, causal-learn, Hypex
* знаешь, что такое causal discovery и DAG — понимаешь, почему конфаундер смещает оценку эффекта
* запускал или анализировал A/B-тесты
* работал с большими данными (Spark, Hadoop)
* разрабатывал LLM-агентов
* имеешь опыт решения задач маркетинга, ценообразования или банковской аналитики
* участвовал в соревнованиях по ML.* комфортный современный офис рядом с м. Ленинский проспект
* возможность выбрать удобный график – офис/гибрид
* срочный трудовой договор на 3 месяца
* корпоративный спортзал и зоны отдыха
* более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
* программа адаптации и помощь руководителя на старте (для вакансий уровня Junior)
* расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
* гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
* подписка Прайм с возможностью совместного использования на трёх близких
* вознаграждение за рекомендацию друзей в команду Сбера.