Data Engineer confirmé - Intelligence Artificielle
La direction des systèmes d'information recherche un / une Data Engineer confirmé(e) - Intelligence Artificielle.
Sous la responsabilité du responsable de la cellule IA & Innovation, vous concevez et exploitez les architectures de données nécessaires aux projets d’intelligence artificielle du Conseil d’État et des juridictions administratives.
Vous garantissez la mise à disposition de données fiables, disponibles, traçables et sécurisées, et contribue à l’industrialisation des traitements associés. En collaboration avec les Data Scientists, les équipes projets et les experts métiers, vous intervenez notamment sur les bases documentaires Ariane, ArianeWeb, ConsiliaWeb, Légifrance et l’Open data.
1/ Ingénierie des données :
- Organiser et automatiser la collecte, la préparation et la mise à disposition des données ;
- Développer et maintenir les échanges nécessaires aux applications métiers et aux équipes de Data Science ;
- Accompagner les équipes projets dans l’exploitation et la valorisation de leurs données.
2/ Infrastructure pour l'Intelligence Artificielle et le MLOps :
- Contribuer à l’architecture et à la mise en œuvre des solutions RAG ;
- Prendre en charge les chaînes d’indexation, de vectorisation et de recherche documentaire ainsi que les référentiels associés ;
- Préparer et alimenter les données nécessaires aux modèles d’IA et de Machine Learning, sans intervenir dans leur conception.
3/ Qualité, Gouvernance et exploitation
- Mettre en place les contrôles garantissant la qualité, la cohérence, la traçabilité et le versionnement des données ;
- Superviser les traitements, contribuer à leur observabilité et à la définition des standards techniques de gestion des données ;
- Assurer une veille sur les outils de Data Engineering, d’intelligence artificielle et de gestion des connaissances.
4/ Objectifs du poste :
- Fiabiliser les données nécessaires aux usages de l’IA générative, analytique et prédictive ;
- Industrialiser les flux et garantir leur qualité dans la durée ;
- Favoriser l’exploitation sécurisée du patrimoine documentaire et des données du Conseil d’État ;
- Contribuer au développement de solutions d’IA souveraines pour la recherche documentaire, l’analyse juridique et l’assistance à la rédaction.
Profil recherché :
Vous avez une formation d'ingénieur d’ingénieur ou master spécialisé en informatique, intelligence artificielle, cloud computing ou data engineering). Une expérience professionnelle équivalente pourra également être prise en compte.
Vous avez au moins 5 ans d’expérience en data engineering, notamment dans la conception et l’exploitation de pipelines de données mais aussi :
- De projets associant LLM, recherche documentaire, embeddings et bases vectorielles, idéalement dans une architecture RAG ;
- De l’industrialisation de traitements de données et de la mise en œuvre d’API ;
- De projets d’IA ou d’un environnement public, sensible ou réglementé est appréciée.
Compétences requises
Data engineering appliqué aux systèmes RAG :
Concevoir et industrialiser des pipelines d’ingestion, de transformation et d’indexation de données documentaires ; Préparer des documents, notamment juridiques, pour leur exploitation par des LLM : extraction des contenus et métadonnées, nettoyage, chunking, enrichissement et vectorisation ;
Mettre en œuvre et optimiser des chaînes d’indexation et de recherche sémantique ou hybride reposant sur les embeddings, les moteurs de recherche et les bases vectorielles ; Assurer l’orchestration, la supervision, la traçabilité, le versionnement et la reprise sur erreur des traitements ; Garantir la qualité et la gouvernance des données, métadonnées et index ; Maîtriser les principes des LLM, de l’IA générative et des architectures RAG ; Contribuer, avec les Data Scientists et les développeurs, à la constitution des jeux de test et à l’évaluation des systèmes RAG : pertinence de la recherche, fiabilité des réponses, sources et performances.
Technologie :
Excellente maîtrise de Python et SQL ; Expérience des outils de traitement et d’orchestration des données : Pandas, PySpark, Airflow ou équivalents ; Expérience des moteurs de recherche et bases vectorielles : OpenSearch, Elasticsearch, Qdrant, Weaviate ou équivalent ; Connaissance d’un framework RAG : LangChain, LlamaIndex ou équivalent ; Maîtrise des API REST et des formats JSON, Parquet et CSV ; Pratique de Git, GitLab CI/CD et Docker ; Kubernetes est un atout.
Sécurité :
Connaissance des principes de protection, de traçabilité et de gestion des accès aux données. Une connaissance des exigences de sécurité applicables aux administrations publiques est appréciée.
Savoir- faire :
Intégrer et fiabiliser des sources de données hétérogènes. Analyser et optimiser les performances des pipelines et des systèmes d’indexation ;
Savoir-être :
Rigueur, esprit d'analyse, autonomie, curiosité, force de proposition, sens du collectif et capacité à vulgariser.
Nous nous engageons à promouvoir la diversité et l'inclusivité dans notre environnement de travail.