Data Engineer
Summary
Builds scalable data pipelines and AI infrastructure for next-gen healthcare research, focusing on ETL, vector databases, and real-time AI data workflows.
Описание
Компания работает в области клинических исследований, технологий здравоохранения и наук о жизни, сосредоточив внимание на разработке масштабируемой инфраструктуры данных для систем искусственного интеллекта следующего поколения.
Задачи
- Проектирование, разработка и сопровождение масштабируемых конвейеров данных и процессов ETL для рабочих нагрузок AI и машинного обучения;
- Создание и оптимизация моделей данных, наборов признаков и семантических слоёв для аналитики и приложений AI;
- Сотрудничество с командами AI и инженерии для обеспечения высококачественных, надёжных и доступных данных;
- Внедрение управления данными, безопасности, мониторинга, отслеживания происхождения и систем наблюдаемости;
- Оптимизация облачных платформ данных для масштабируемости, надёжности и экономической эффективности;
- Разработка потоковых и событийно-ориентированных конвейеров данных для приложений AI в реальном времени;
- Проектирование систем хранения и поиска для векторных баз данных, графов знаний и артефактов AI;
- Реализация автоматизированной проверки данных, тестирования схем и процессов обеспечения качества;
- Мониторинг и устранение неполадок конвейеров данных для обеспечения эксплуатационной надёжности;
- Отслеживание последних тенденций в области инженерии данных, облачных технологий и AI.
Требования
- Степень бакалавра или магистра в области компьютерных наук, инженерии данных или смежной области;
- Более 5 лет опыта работы в области инженерии данных, включая минимум 2 года поддержки инфраструктуры AI или машинного обучения;
- Сильные навыки программирования на Python и Scala;
- Опыт работы с SQL, NoSQL и распределёнными вычислительными фреймворками;
- Опыт работы с облачными платформами (AWS, Azure или GCP), Docker, Kubernetes, Terraform и современными инструментами оркестрации, такими как Airflow;
- Знание потоковых технологий, архитектур lakehouse, векторных баз данных и рабочих процессов AI данных;
- Сильные навыки решения проблем, сотрудничества и технического лидерства, включая опыт наставничества инженеров и внесения вкладов в архитектурные решения;
- Преимуществом: Spark, Kafka, Flink, хранилища признаков, системы RAG, обработка данных LLM, MLOps.
Условия
Нет указанных условий.