Senior Data Analyst (Scala API)
Summary
Build and optimize high-load Scala/Spark pipelines for NPL analytics, engineer clean features for ML teams, and integrate generative AI into data workflows.
О проекте:
Мы разрабатываем и внедряем DS-модели и AI-агентов в Департаменте по работе с проблемными активами (NPL). Мы понимаем, что их эффективность напрямую зависит от фундамента — качественно проанализированных, подготовленных и высокопроизводительных данных.
Обязанности
- Разработка высоконагруженных пайплайнов обработки больших данных исключительно на Scala API DataFrame Apache Spark (без SQL), включая оптимизацию производительности (Performance Tuning) и устранение data skew.
- Проектирование архитектуры хранения: моделирование данных с применением подходов Data Vault или Dimensional Modeling, участие в проектировании DWH.
- Подготовка и предоставление чистых, структурированных фичей (feature engineering) для команд DS/ML, понимание жизненного цикла внедрения ML-моделей.
- Обработка больших объемов неструктурированных данных и интеграция результатов работы генеративного ИИ в аналитические процессы.
- Работа с ядром Spark: анализ планов выполнения запросов через Catalyst Optimizer, выявление и решение проблем производительности на уровне кода.
- Участие в код-ревью, ведение разработки в Git, написание модульных тестов и поддержание высокого качества кодовой базы команды.
- Трансляция бизнес-задач от стейкхолдеров в технические требования к данным и архитектуре потоков.
Требования
- Релевантный опыт от 3 лет на позиции Data-аналитика/Аналитика DWH с фокусом на разработку production-ready решений.
- Экспертное владение Scala API для работы с DataFrame Apache Spark. Опыт реализации проектов исключительно на Scala без использования SQL.
- Глубокое понимание этапов оптимизации Catalyst, умение читать планы выполнения (Explain) и проводить Performance Tuning.
- Практический опыт участия во внедрении ML-моделей и уверенное знание этапов их жизненного цикла (от подготовки данных до мониторинга).
- Навыки проектирования высоконагруженных систем и знакомство с архитектурными подходами Data Vault или Dimensional Modeling.
- Уверенная работа с большими объемами неструктурированных данных и применение инструментов генеративного ИИ для автоматизации задач.
- Высшее техническое образование, владение Git и опыт прохождения код-ревью.
Будет плюсом:
- Опыт использования GigaChat, Kandinsky и аналогов в продуктах, навыки создания и использования AI-агентов.
Условия
- Офисный формат работы: г. Москва, Кутузовский проспект, д. 32, к.1.
- Ежегодный пересмотр зарплаты и годовая премия.
- Более 400 образовательных программ в СберУниверситете для твоего развития.
- Спортзал и зоны отдыха.
- Расширенный ДМС, льготное страхование для семьи.
- Гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ.
- Подписка Прайм с возможностью совместного использования на трёх близких.
- Вознаграждение за рекомендацию друзей в команду Сбера.
- Срочный трудовой договор.