Data engineer
Summary
Early-career data engineer at Edumapper (Paris) who builds and maintains the data pipelines and AI agents that collect, structure, and keep the French higher-education course catalog up to date, plus product analytics. Stack: Python, SQL, Dagster, DuckDB, and generative AI (LLMs, agents, RAG).
Mission : construire et faire évoluer les pipelines et les agents IA qui alimentent le catalogue de formations d’Edumapper, en garantissant la fiabilité de la donnée produite.
Edumapper modélise l’offre d’études supérieures française et ses débouchés professionnels. Notre référentiel de formations est le cœur du produit : plus il est complet, structuré et à jour, mieux nous aidons les lycéens à faire les bons choix d’orientation. Or cette information est aujourd’hui éclatée entre des milliers de sites d’établissements, dans autant de formats différents, et se renouvelle en permanence. C’est précisément l’objet de ce poste : la collecter, la structurer et la maintenir à jour.
En collaboration directe avec Romain Boyer, notre Head of Data, les co-fondateurs et le reste de l’équipe, tu prends la responsabilité de la chaîne de données, de la collecte jusqu’à la mise à disposition :
Agents d’enrichissement du catalogue. Maintenir et faire évoluer notre workflow d’agents IA qui complète automatiquement la base de formations à partir de sources hétérogènes (sites d’établissements, Parcoursup, référentiels publics…) : élargir la couverture, absorber les évolutions des sources, améliorer la précision de l’extraction.
Collecte et mise à disposition des données. Récupérer, traiter et exposer des données de natures très variées : ingestion, normalisation, modélisation et mise à disposition auprès des équipes produit, tech et science.
Qualité du référentiel. Garantir la fiabilité de la base Edumapper : contrôles automatisés, déduplication et résolution d’entités, monitoring des pipelines. En lien étroit avec les équipes tech et science pour définir et diffuser les bonnes pratiques de modélisation.
Analytics. Mettre en place les analytics d’Edumapper, principalement construits sur le comportement de nos utilisateurs : instrumentation, modélisation des événements, restitution pour piloter le produit et l’activité.
Notre stack : Python, SQL, Dagster, DuckDB et les briques d’IA générative (LLM, agents, RAG) qui vont avec.
Tu portes tes sujets du prototype à la production, en revue avec Romain notre Head of Data, sur un périmètre directement visible dans le produit.
Edumapper est un environnement idéal pour les passionnés de traitement et de transformation de la donnée, rigoureux et autonomes, appréciant les petites équipes et désireux de participer à la conception d’un produit à fort impact social. Nous recherchons un(e) data engineer en début de carrière, très à l’aise en Python, qui a envie de faire de l’ingénierie de la donnée pour de vrai : modéliser proprement, construire des pipelines robustes, et mettre en production. Nous n’attendons pas un profil senior, mais des bases techniques solides, de la rigueur, et l’envie de monter en compétences sur l’ensemble du métier (de l’IA générative à l’analytics, en passant par la modélisation et la qualité de la donnée).
Compétences techniques
Très bon niveau en Python : c’est le socle du poste.
Bonnes bases en SQL et goût pour l’intégration de données hétérogènes dans des référentiels proprement modélisés.
Expérience de construction de flux de traitement de données (ETL / ELT) ; la prise en main d’un orchestrateur (Dagster, Airflow, dbt…) est un vrai plus.
Un fort intérêt pour les technologies d’IA générative (LLM, agents, RAG) et le web scraping, idéalement une première expérience sur ces sujets.
Une sensibilité aux enjeux de qualité et de test de la donnée ; la connaissance de DuckDB ou d’outils d’analytics produit sera appréciée.
Parcours
Diplômé(e) d’une grande école d’ingénieurs ou d'un Master en informatique, data science, mathématiques appliquées, statistique ou domaine connexe.
0 à 2 ans d’expérience, stages et alternances compris : un premier poste ou une alternance sur des sujets data est un excellent point de départ.
Des projets personnels, académiques ou associatifs autour de la donnée, du scraping ou des LLM sont un excellent signal : n’hésite pas à nous les partager.
Compétences interpersonnelles
Rigueur et exigence sur la qualité de ce que tu produis.
Curiosité et désir fort d’apprendre de nouveaux outils et technologies.
Bonne communication, capacité à collaborer avec des interlocuteurs techniques et non techniques.
Autonomie face à un sujet ouvert : savoir avancer, poser les bonnes questions, itérer.
Un intérêt pour le monde de l’éducation et de l’orientation est un plus.
Infos pratiques
Contrat : CDI
Localisation : Paris 8e
Remote : 4 jours au bureau, 1 jour en télétravail optionnel. Chez Edumapper, on est convaincus que les meilleures idées naissent ensemble, autour d’un café, d’un tableau blanc gribouillé, d’une discussion spontanée. Le full remote n’est pas une option à court terme.
Macbook à disposition
Démarrage : dès que possible
Rémunération : 43 à 52k