freehire launches on Product Hunt on 26 August.

Follow →

Senior/ TL Data engineer

Summary

Build and optimize a company-wide Data Lakehouse using Spark, Iceberg, and Hadoop to centralize B2C data, focusing on high-load batch and streaming pipelines.

Наша команда занимается амбициозной и стратегически важной задачей – построение единого хранилища данных блока B2C - централизованное и эталонное место хранения данных. Мы ищем сильного инженера данных для работы с крупными распределенными системами. Наш стек строится вокруг экосистемы Hadoop, и мы активно развиваем платформу в сторону Data Lakehouse на базе Apache Iceberg и Data Streamhouse на базе Kafka и Apache Flink. Вам предстоит работать с высоконагруженными системами, потоковой обработкой и участвовать в построении единого хранилища данных компании. **Мы предлагаем:** · Интересные задачи по построению **Data Lakehouse** на базе **Apache Spark** и **Apache Iceberg**. · Работу с большими объемами данных и современным стеком технологий. · Возможность влиять на архитектурные решения. **Ключевые технологии в вакансии:** SQL, Java, Scala, Python, Apache Spark, Apache Iceberg, Apache Hadoop, Greenplum, Gluten, Velox, Oozie, Jenkins, Doker.**Разработка и оптимизация витрин данных:** * проектирование и реализация эффективных **ETL** и **ELT** процессов для витрин данных с использованием **Apache Spark** и **Greenplum**. Обеспечение высокой производительности и отказоустойчивости пайплайнов. **Архитектура данных:** * поддержание и развитие текущих пайплайнов обработки данных на **Hadoop** с использованием **Apache Spark.** * разработка предложений по развитию **Data Lakehouse**, внедрение best practices работы с **Apache Iceberg** (оптимизация партиционирования, compaction, time travel). **Инженерные практики:** * реализация механизмов **инкрементальной загрузки** данных для минимизации времени обработки и нагрузки на источники. * разработка и документирование **API** (на **Java** или **Scala**) для доступа к данным витрин и сервисам семантического слоя. **Производительность и качество:** * глубокая **оптимизация Spark-приложений**, включая использование векторного движка **Gluten/Velox** для ускорения рабочих нагрузок. * разработка решений для **сверки и контроля качества данных** (**Data Quality**) с использованием **Spark** и **Python**. * **DevOps и CI/CD:** Внедрение разработанных решений в продуктовую среду. Настройка пайплайнов сборки и деплоя в **Jenkins**, управление зависимостями задач в **Oozie** или современных оркестраторах. **Коммуникация:** Взаимодействие с внутренними бизнес заказчиками для уточнения и согласования требований, презентация доработок сервиса* уверенное владение языками: **SQL**, **Java** (или **Scala**), **Python** (как вспомогательный для **ad-hoc** анализа и **DQ**). * глубокое понимание экосистемы **Apache Hadoop** (HDFS, YARN) и опыт работы с ней в продакшене. * опыт разработки пайплайнов на **Apache Spark** (Core, SQL, Structured Streaming) уровня не ниже middle. * понимание форматов хранения данных (**Parquet, ORC, Avro**) и современных подходов к управлению Data Lakehouse (обязательно знание **Apache Iceberg**). * опыт оптимизации производительности **Apache Spark** (настройка ресурсов, устранение перекосов данных, работа с memory, оптимизация shuffle). **Будет большим плюсом:** * опыт внедрения промышленных пайплайнов пакетной передачи данных. * опыт внедрения **Gluten/Velox** или аналогичных векторизованных движков. * навыки сборки и развертывания **Doker**\-образов приложений.* офисный формат работы (м Кутузовская) * корпоративный спортзал и зоны отдыха * более 400 образовательных программ СберУниверситета для профессионального и карьерного развития * регулярные митапы и развитое DS-community * расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа * гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ * подписка Прайм с возможностью совместного использования на трёх близких * вознаграждение за рекомендацию друзей в команду Сбер.

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available