freehire launches on Product Hunt on 26 August.

Follow →

Data Engineer F/H H/F

Summary

Build and maintain robust data pipelines on AWS to process terabytes of media audience, adserver, and CRM data, enabling predictive products and ad-revenue insights.

Le Groupe M6 est l'un des groupes audiovisuels les plus importants de France, avec un portefeuille de chaînes comprenant M6, W9, 6ter, Gulli, Paris Première, Téva, ainsi que des stations de radio (RTL, RTL2, Fun Radio) et des services numériques. Le Groupe M6 est à la pointe de l’innovation numérique et de la transformation des médias, avec un engagement fort dans l’exploitation des données pour améliorer l’expérience utilisateur et optimiser ses revenus publicitaires.

Responsabilités

  • Concevoir et opérer des pipelines de données robustes sur AWS (S3, Glue, Athena, MWAA, EMR, ECS).
    Optimiser la performance et la gouvernance sur l’ensemble du cycle de vie (monitoring, coûts, sécurité IAM).
  • Analyser des données volumineuses issues de l'adserver, du CRM, des audiences et de la radio pour produire des insights actionnables.
  • Développer des traitements optimisés et industrialisables en Python (Pandas, PySpark, AWS Wrangler).
  • Produire et optimiser du SQL avancé pour les analyses et pipelines (CTE, window, performance tuning, partitionnement).
  • Gérer et optimiser les traitements Spark pour gérer les téraoctets du datalake.
  • Construire des KPI métier pour la régie publicitaire, le CRM, la radio et les équipes audiences.
  • Mettre en place des modèles de données solides (datalake raw → golden), avec Parquet, Iceberg ou Delta Lake.

Collaboration et innovation

  • Collaborer avec les data scientists pour élaborer des produits et services prédictifs robustes.
  • Effectuer une veille scientifique et technologique pour nourrir les innovations au sein du groupe.
  • Accompagner les équipes métier (régie publicitaire, streaming, CRM, études TV) dans l’exploitation des insights data.

Qualifications

  • Diplôme Bac+5 minimum en Data Engineering, Mathématiques appliquées, Statistiques ou domaine équivalent (École d’ingénieur ou Master spécialisé).
  • Expérience de 2 ans minimum en data engineering; l’expérience dans le secteur des médias est un plus.

Compétences techniques

  • Expertise en Python et en data engineering.
  • Maîtrise avancée de Python appliqué au traitement de données (Pandas, PySpark, AWS Wrangler), structuration de projets, optimisation des performances et bonnes pratiques de développement.
  • Très bon niveau en SQL pour interroger, transformer et optimiser des datasets volumineux (CTE, window functions, tuning, broadcast join).
  • Expérience solide des environnements cloud – AWS, comprenant S3, Glue, Athena, Lambda, MWAA, ECS, IAM et la gestion du datalake en zones (raw → golden).
  • Industrialisation et orchestration des pipelines.
  • Compétence confirmée dans la création et la gestion de pipelines avec MWAA, incluant la mise en production, la surveillance, l’optimisation et la fiabilité des workflows.
  • Traitement de données à grande échelle et maîtrise de Spark (optimisation, partitionnement) pour les workloads distribués, et utilisation avancée de Pandas pour les traitements.
  • Expérience avec les formats modernes et transactionnels : Parquet, Delta Lake, Iceberg.
  • Connaissance des données CRM/ADserveur ainsi que Terraform est un plus.

Compétences personnelles

  • Excellente capacité de modélisation, d’analyse et de synthèse.
  • Curiosité intellectuelle et forte appétence pour l’innovation.
  • Sens pédagogique et capacité à vulgariser des concepts complexes.
  • Autonomie et esprit d’initiative.
  • Capacité à travailler en équipe multidisciplinaire.

See also