freehire launches on Product Hunt on 26 August.

Follow →

Data Engineer

Summary

Builds scalable data pipelines and AI infrastructure for next-gen healthcare research, focusing on ETL, vector databases, and real-time AI data workflows.

Описание

Компания работает в области клинических исследований, технологий здравоохранения и наук о жизни, сосредоточив внимание на разработке масштабируемой инфраструктуры данных для систем искусственного интеллекта следующего поколения.

Задачи

  • Проектирование, разработка и сопровождение масштабируемых конвейеров данных и процессов ETL для рабочих нагрузок AI и машинного обучения;
  • Создание и оптимизация моделей данных, наборов признаков и семантических слоёв для аналитики и приложений AI;
  • Сотрудничество с командами AI и инженерии для обеспечения высококачественных, надёжных и доступных данных;
  • Внедрение управления данными, безопасности, мониторинга, отслеживания происхождения и систем наблюдаемости;
  • Оптимизация облачных платформ данных для масштабируемости, надёжности и экономической эффективности;
  • Разработка потоковых и событийно-ориентированных конвейеров данных для приложений AI в реальном времени;
  • Проектирование систем хранения и поиска для векторных баз данных, графов знаний и артефактов AI;
  • Реализация автоматизированной проверки данных, тестирования схем и процессов обеспечения качества;
  • Мониторинг и устранение неполадок конвейеров данных для обеспечения эксплуатационной надёжности;
  • Отслеживание последних тенденций в области инженерии данных, облачных технологий и AI.

Требования

  • Степень бакалавра или магистра в области компьютерных наук, инженерии данных или смежной области;
  • Более 5 лет опыта работы в области инженерии данных, включая минимум 2 года поддержки инфраструктуры AI или машинного обучения;
  • Сильные навыки программирования на Python и Scala;
  • Опыт работы с SQL, NoSQL и распределёнными вычислительными фреймворками;
  • Опыт работы с облачными платформами (AWS, Azure или GCP), Docker, Kubernetes, Terraform и современными инструментами оркестрации, такими как Airflow;
  • Знание потоковых технологий, архитектур lakehouse, векторных баз данных и рабочих процессов AI данных;
  • Сильные навыки решения проблем, сотрудничества и технического лидерства, включая опыт наставничества инженеров и внесения вкладов в архитектурные решения;
  • Преимуществом: Spark, Kafka, Flink, хранилища признаков, системы RAG, обработка данных LLM, MLOps.

Условия

Нет указанных условий.

See also