Аналитик данных/инженер данных
Мы ищем сильного технического аналитика данных, который умеет не только работать с готовыми данными, но и самостоятельно выстраивать весь процесс: от загрузки и трансформации до витрин, автоматизаций и контроля качества.
Вам предстоит:
- Разработка и поддержка витрин данных.
- Автоматизация процессов на Python и Airflow.
- Написание и оптимизация сложных SQL-запросов.
- Работа с большими объемами данных в Spark.
- Загрузка данных в КХД из Excel, API и различных БД.
- Перенос и объединение данных между разными системами и СУБД.
- Проектирование структуры таблиц и архитектуры данных.
- Разработка ad hoc автоматизаций и внутренних решений.
- Настройка чекеров и Data Quality: полнота, дубли, freshness, аномалии, бизнес-правила.
- Мониторинг загрузок, витрин и алертов при ошибках.
Что важно:
- Сильный SQL и понимание оптимизации запросов.
- Уверенный Python.
- Практический опыт с Airflow и Spark / PySpark.
- Понимание ETL / ELT и принципов построения data pipelines.
- Знание разных типов СУБД и их особенностей: PostgreSQL / Greenplum, ClickHouse, Trino / Presto или аналогов.
- Понимание OLTP / OLAP, column-store / row-store, MPP-архитектуры.
- Умение проектировать таблицы, выбирать гранулярность, ключи, партиционирование и структуру витрин.
Будет плюсом:
- Опыт построения DWH.
- dbt, Kafka, Docker, Git / CI/CD.
- Great Expectations, Soda или другие инструменты Data Quality.
- Опыт работы с Data Lineage и Data Observability.
Ищем человека, который может получить задачу в формате «есть несколько источников, Excel и API, нужно собрать надежную витрину» и самостоятельно довести ее до работающего автоматизированного решения.
Формат работы - гибридный по договоренности с руководителем