Data Engineer
Summary
Remote (Russia) data engineer on the integration-platforms team: builds metadata ingestion flows into a unified integration layer, writes Python scripts that auto-generate DDL/DML and Airflow DAGs, and maintains Iceberg tables. Core stack: PySpark, Airflow, Hadoop, Kafka, Iceberg, S3, Kubernetes and many DBs (PostgreSQL, Oracle, MS-SQL, ClickHouse).
до 350к gross (до ~305к net)
Команда: интеграционные среды.
Стек технологий:
СУБД: PostgreSQL, MS-SQL, Oracle, ClickHouse, DB2, Tarantool, Elasticsearch, Hadoop (Impala, Hive).
Data Stack: Hadoop, S3, Impala, Hive, Spark, Iceberg, Kafka, Elasticsearch.
Языки программирования: Python (Pandas, NumPy, Matplotlib), C#, SQL.
Инструментарий: Git, Jira, Kubernetes.
- Развитие интеграционной среды: разработка потоков подключения метаданных информационных систем к Единому интеграционному слою и витрине DMDC.
- Автоматизация и шаблонизация: создание шаблонов в платформе управления метаданными для обеспечения подключения ключевых типов СУБД (PostgreSQL, Oracle, MS-SQL, ClickHouse, DB2, Elasticsearch, Tarantool).
- Разработка инструментов автоматизации: проектирование Python-скриптов для автоматической генерации DDL/DML запросов и Airflow DAG для процессов загрузки и обслуживания данных.
- Поддержка и оптимизация: исправление ошибок существующих потоков, а также разработка Airflow DAG для обслуживания таблиц Iceberg с применением кастомных операторов (оптимизация чтения при наличии значительного количества delete-файлов).
- Модернизация витрины: доработка функциональности витрины DMDC для обеспечения полной поддержки возможностей каталога данных.
- Документирование: подготовка и ведение проектной документации по результатам разработки.
- Глубокая экспертиза в разработке на PySpark и написании сценариев Airflow.
- Опыт работы с высоконагруженными распределенными системами обработки и хранения данных (Hadoop).
- Практические навыки конфигурации и оптимизации Spark-приложений и управления ресурсами Spark.
- Опыт работы со стеком: Streaming/Storage/Messaging: Spark Streaming, Iceberg, Kafka, S3.
- Навыки работы с контейнеризацией и оркестрацией в среде Kubernetes (K8s).
- Опыт проведения нагрузочного тестирования систем обработки данных.
- Экспертное владение SQL и навыками оптимизации сложных запросов.
- Знание основ математической статистики, анализа данных и основ машинного обучения (PyTorch, TensorFlow).
- Умение работать в условиях распределенных систем и обеспечивать консистентность данных при автоматическом определении типов схем.
Развитие и обучение
Проекты для крупного бизнеса, внутренние митапы и разговорные клубы английского языка
Забота и поддержка
Служба заботы о сотрудниках и индивидуальное сопровождение каждого коллеги на всех этапах развития в компании. А еще — ДМС со стоматологией и регулярная обратная связь
Комфорт
Работа в аккредитованной IT-компании, зарплата по рынку, техника для работы и человекоцентричный подход, где сотрудник = внутренний клиент компании
Драйвовое комьюнити
Команда прокаченных специалистов, внутренние события и уникальная корпоративная культура с маскотом IT-тигроми поддерживающим комьюнити