Data Engineer (scala)
Summary
Builds and maintains robust data pipelines in Scala/Spark for a legal domain, optimizing SQL and Spark jobs while ensuring data integrity and collaborating with DevOps for CI/CD.
Ищем самостоятельного дата-инженера для развития потоков данных в прикладном \_Legal\_-домене. Вам предстоит строить надежные пайплайны от источников до автоматизированных систем-получателей.* cбор, анализ и формализация требований от бизнес-технологов (_БТ_) и владельцев продуктов юридического блока
* поиск, исследование и подключение новых источников данных внутри КАП под задачи правового департамента
* выполнение разовых _(Ad-hoc)_ запросов по заявкам бизнеса для проработки требований, точечного анализа юридических метрик или поиска аномалий в данных
* разработка ETL -процессов на Scala (Apache Spark 3.2+) с последующей пакетной доставкой подготовленных витрин данных в смежные автоматизированные системы (АС)
* оптимизация производительности SQL-запросов к данным уровня HOF (_Head of Function_, сложные CTE, оконные функции, партиционирование) и Scala-кода
* обеспечение стабильности работы продуктивных потоков: разбор инцидентов третьей линии поддержки (_L3_), восстановление целостности данных после сбоев, работа с логами YARN/HDFS
* взаимодействие с командами DevOps для настройки CI/CD пайплайнов доставки кода и оркестрации задач
* ведение технической документации в Confluence и управление задачами в Jira.* опыт работы Data Engineer от 2–3 лет
* уверенное владение Apache Spark (версии 2.x или 3.x). **Обязательно знание Scala как основного языка разработки трансформаций**
* Глубокое понимание архитектуры экосистемы Hadoop (YARN, HDFS, Hive Metastore)
* экспертный уровень SQL: свободное использование оконных функций (ROW\_NUMBER, RANK, LAG/LEAD), сложных джоинов и вложенных запросов
* навык анализа требований бизнеса и перевода их на язык технических спецификаций
* практический опыт расследования и устранения последствий инцидентов L3 в продуктивной среде больших данных
* самостоятельность: умение декомпозировать задачу, оценить сроки и довести ее до релиза без микроменеджмента
* знакомство с инструментами _DevOps_ и практиками CI/CD применительно к доставке Spark-приложений
* будет плюсом: опыт использования AI-инструментов в разработке (LLM-ассистенты для написания и ревью кода, агенты для автоматизации рутинных операций, инструменты автодополнения вроде GitHub Copilot)
Будет плюсом:
* опыт работы с данными в финансовом секторе, ритейле или телекоме; знакомство со специфическими юридическими источниками
* навыки работы с генеративными AI-моделями.* формат работы офис, локация офиса ул Вавилова д.19
* ежегодный пересмотр зарплаты, квартальная и годовая премия
* корпоративный спортзал и зоны отдыха
* более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
* расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
* гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
* подписка Прайм с возможностью совместного использования на трёх близких
* вознаграждение за рекомендацию друзей в команду Сбера.