Data Engineer
Summary
Data engineer on a Sberbank project building a B2B recommendation and communication-planning system: designing and maintaining big-data ETL/ELT pipelines, Airflow DAGs, analytical data marts, and integrating ML models into production. Core stack: SQL, Hadoop, Greenplum (MPP), Apache Airflow.
КОМПАНИЯ «АЙ-ТЕКО» - ведущий российский системный интегратор и поставщик информационных технологий для корпоративных заказчиков. Активно действует на рынке IT России с 1997 года, входит в ТОП-400 крупнейших российских компаний, ТОП-10 крупнейших IT-компаний России.
В связи с активным развитием проектов в компании открыта вакансия Data инженера на проект Сбера.
О проекте
Кластер «Рекомендательная система КИБ» развивает решения для гиперперсонализированного взаимодействия с B2B-клиентами.
Один из ключевых проектов — Планировщик коммуникаций и приоритизатор. Система помогает определить наиболее подходящую рекомендацию для конкретного человека в бизнесе с учетом его роли, клиентского контекста, доступных предложений, каналов коммуникации и текущего момента.
Проект находится на стыке Big Data, аналитики, ML, алгоритмов принятия решений и backend-разработки. Здесь предстоит работать с большими объемами данных, проектировать и развивать data pipeline, аналитические витрины и решения для промышленной обработки данных.
Чем предстоит заниматься
- Разрабатывать и поддерживать процессы обработки больших объемов данных;
- проектировать и развивать ETL/ELT-процессы;
- разрабатывать и поддерживать DAG в Apache Airflow;
- работать с Hadoop и MPP-СУБД;
- строить и развивать аналитические витрины;
- обеспечивать качество и корректность данных;
- участвовать в интеграции данных и ML-моделей в промышленные процессы;
- взаимодействовать с аналитиками, ML-инженерами и разработчиками;
- вести техническую документацию.
Наши ожидания
- Уверенное знание SQL;
- опыт работы с Hadoop;
- опыт работы с распределенной обработкой больших данных;
- опыт работы с Greenplum или другими MPP-СУБД;
- опыт разработки и поддержки DAG в Airflow;
- понимание принципов ETL/ELT;
- опыт построения аналитических витрин;
- опыт контроля качества данных;
- навыки технического документирования.
Будет плюсом
- Spark / PySpark;
- опыт работы с потоковыми или near-real-time данными;
- знание Kafka или аналогичных технологий;
- понимание процессов DevOps;
- опыт интеграции ML-моделей в промышленный data pipeline.
Почему проект интересный
Вы будете работать не просто с готовыми ETL-процессами, а с системой, которая непосредственно влияет на качество клиентского опыта и эффективность коммуникаций с корпоративными клиентами.
В проекте много задач на стыке данных, ML и backend, где необходимо не только реализовывать существующие решения, но и участвовать в поиске и проверке новых подходов.