freehire launches on Product Hunt on 26 August.

Follow →

Data Engineer Modern Data Stack F/H

Summary

Build and maintain cloud-based data pipelines in Python/SQL, design modern data platforms (Azure/AWS/GCP), and ensure data quality and observability for analytics and AI projects.

Votre rôle

Présente à Lyon, Grenoble, Marseille et Nice, l'agence Conseil & Expertise Grand Sud-Est intervient en synergie avec les agences sectorielles et géographiques d'Orange Business sur les périmètres suivants : Stratégie, Gouvernance & Trust, Architecture, Infrastructure, Services, et Acculturation.

Vos missions :

  • Concevoir, développer et maintenir des pipelines d'ingestion et de transformation de données (batch et temps réel) en Python et SQL.
  • Mettre en oeuvre des Modern Data Platforms sur le cloud (Azure, AWS, GCP) : Data Lake, Data Warehouse, zones raw / cleansed / business.
  • Industrialiser les traitements : orchestration, CI/CD, tests, reprise sur erreur, déploiement via IaC.
  • Mettre en place les contrôles de qualité de données et l'observabilité associée (fraîcheur, complétude, lineage, alerting).
  • Contribuer aux projets liés à la donnée et à l'IA (LLM chatbot, RAG, Azure AI/ML services) en exposant des données fiables et exploitables.
  • Optimiser les performances et les coûts des traitements (partitionnement, formats defichiers, dimensionnement, FinOps), y compris sur des architectures hybrides intégrant des environnements on-premise.

Votre profil

  • Expérience: au moins 5 ans sur des projets de data engineering, dont une expérience significative sur la mise en production de pipelines en environnement cloud.
  • Python: maîtrise confirmée (code structuré, testé, packagé), ainsi queSQL avancé.
  • Intégration & transformation: dbt, Spark / PySpark, Talend, Kafka / Kafka Connect, Nifi, Airbyte ou équivalents — plusieurs outils du marché pratiqués.
  • Orchestration: Airflow, Dagster, Prefect, Azure Data Factory.
  • Cloud: maîtrise d'au moins une des plateformes (Azure, GCP, AWS) avec une expérience significative sur ses services data (BigQuery, Synapse, Databricks, Snowflake, Redshift…).
  • IaC: Terraform, AWS CDK, Bicep.
  • CI/CD: GitHub Actions, GitLab CI/CD, Jenkins.
  • Data/AI (un plus): connaissance des plateformes MLOps, services AI/ML cloud, formats et moteurs de table (Parquet, Delta Lake, Iceberg).
  • Cloud hybride :expérience des déploiements et intégrations avec des infrastructures on-premise.

See also