Senior/ TL Data engineer
Summary
Build and optimize a company-wide Data Lakehouse using Spark, Iceberg, and Hadoop to centralize B2C data, focusing on high-load batch and streaming pipelines.
Наша команда занимается амбициозной и стратегически важной задачей – построение единого хранилища данных блока B2C - централизованное и эталонное место хранения данных. Мы ищем сильного инженера данных для работы с крупными распределенными системами. Наш стек строится вокруг экосистемы Hadoop, и мы активно развиваем платформу в сторону Data Lakehouse на базе Apache Iceberg и Data Streamhouse на базе Kafka и Apache Flink. Вам предстоит работать с высоконагруженными системами, потоковой обработкой и участвовать в построении единого хранилища данных компании.
**Мы предлагаем:**
· Интересные задачи по построению **Data Lakehouse** на базе **Apache Spark** и **Apache Iceberg**.
· Работу с большими объемами данных и современным стеком технологий.
· Возможность влиять на архитектурные решения.
**Ключевые технологии в вакансии:** SQL, Java, Scala, Python, Apache Spark, Apache Iceberg, Apache Hadoop, Greenplum, Gluten, Velox, Oozie, Jenkins, Doker.**Разработка и оптимизация витрин данных:**
* проектирование и реализация эффективных **ETL** и **ELT** процессов для витрин данных с использованием **Apache Spark** и **Greenplum**. Обеспечение высокой производительности и отказоустойчивости пайплайнов.
**Архитектура данных:**
* поддержание и развитие текущих пайплайнов обработки данных на **Hadoop** с использованием **Apache Spark.**
* разработка предложений по развитию **Data Lakehouse**, внедрение best practices работы с **Apache Iceberg** (оптимизация партиционирования, compaction, time travel).
**Инженерные практики:**
* реализация механизмов **инкрементальной загрузки** данных для минимизации времени обработки и нагрузки на источники.
* разработка и документирование **API** (на **Java** или **Scala**) для доступа к данным витрин и сервисам семантического слоя.
**Производительность и качество:**
* глубокая **оптимизация Spark-приложений**, включая использование векторного движка **Gluten/Velox** для ускорения рабочих нагрузок.
* разработка решений для **сверки и контроля качества данных** (**Data Quality**) с использованием **Spark** и **Python**.
* **DevOps и CI/CD:** Внедрение разработанных решений в продуктовую среду. Настройка пайплайнов сборки и деплоя в **Jenkins**, управление зависимостями задач в **Oozie** или современных оркестраторах.
**Коммуникация:** Взаимодействие с внутренними бизнес заказчиками для уточнения и согласования требований, презентация доработок сервиса* уверенное владение языками: **SQL**, **Java** (или **Scala**), **Python** (как вспомогательный для **ad-hoc** анализа и **DQ**).
* глубокое понимание экосистемы **Apache Hadoop** (HDFS, YARN) и опыт работы с ней в продакшене.
* опыт разработки пайплайнов на **Apache Spark** (Core, SQL, Structured Streaming) уровня не ниже middle.
* понимание форматов хранения данных (**Parquet, ORC, Avro**) и современных подходов к управлению Data Lakehouse (обязательно знание **Apache Iceberg**).
* опыт оптимизации производительности **Apache Spark** (настройка ресурсов, устранение перекосов данных, работа с memory, оптимизация shuffle).
**Будет большим плюсом:**
* опыт внедрения промышленных пайплайнов пакетной передачи данных.
* опыт внедрения **Gluten/Velox** или аналогичных векторизованных движков.
* навыки сборки и развертывания **Doker**\-образов приложений.* офисный формат работы (м Кутузовская)
* корпоративный спортзал и зоны отдыха
* более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
* регулярные митапы и развитое DS-community
* расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
* гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
* подписка Прайм с возможностью совместного использования на трёх близких
* вознаграждение за рекомендацию друзей в команду Сбер.