Инженер данных
Summary
Build real-time feature pipelines and embeddings for ML models using Spark/Flink and Kafka, then serve them to data scientists.
- Разрабатывать сервисы потокового (real-time) расчета признаков (фичей) для моделей машинного обучения;
- Разрабатывать сервисы векторизации - вычисление embedding-векторов и сохранение в векторном хранилище;
- Создавать витрины данных для моделей машинного обучения;
- Взаимодействовать со специалистами по анализу данных и специалистами по развитию инфраструктуры.
- Знание инструментов для обработки больших массивов данных: SQL, Python;
- Хорошие знания платформы Apache Spark Structured Streaming и/или Apache Flink;
- Понимание принципов потоковой обработки данных;
- Знание и опыт использования платформы потоковой обработки данных Apache Kafka.
- Стабильный и прозрачный доход: размер заработной платы обсуждается по итогам собеседования;
- Пятидневную рабочую неделю по графику 5/2. Возможен удаленный или гибридный формат работы;
- Работа в офисном пространстве нового поколения;
- ДМС со стоматологией, страхованием жизни и страхованием выезжающих за рубеж с первого дня трудоустройства;
- Профессиональный рост: тренинги в Альфа-Академии, вебинары, доступ к бесплатным корпоративным библиотекам;
- Скидки и льготы на услуги банка и компаний-партнеров.