Senior AI/LLM Engineer - IA Générative & Agentique (RAG, Fine-tuning, Inférence) - Freelance (H/F)
Collective.work Senior AI/LLM Engineer - IA Générative & Agentique (RAG, Fine-tuning, Inférence) - Freelance (H/F)
Vous rejoignez la division IA d'une grande banque d'investissement européenne, au sein de la plateforme CIB. L'équipe Data Science conçoit et délivre des produits IA déjà en production : extraction automatisée de données à partir de documents financiers, chatbot agentique et génération de données. Ces produits sont utilisés au quotidien par les équipes métiers - vos améliorations ont un impact direct et mesurable.
VOS MISSIONS
- Concevoir, fine-tuner et améliorer des pipelines RAG et agentiques en production
- Travailler sur l'inférence de modèles : déploiement de LLMs sur GPU (vLLM), optimisation latence / débit / coûts
- Mettre en place l'évaluation et l'observabilité des pipelines IA (Phoenix/Arize, DSPy) : datasets d'évaluation, métriques de qualité, boucles d'amélioration continue
- Améliorer en continu la qualité d'extraction et les performances des agents
- Partager vos connaissances et coacher les profils moins expérimentés
POURQUOI CETTE MISSION
- Des produits GenAI réellement en production, dans un environnement exigeant et à fort impact
- Une stack à l'état de l'art : vLLM, LangGraph, Google ADK, DSPy, Phoenix (Arize)
- Un vrai mandat technique : du delivery, pas des slides
- L'opportunité d'apporter un regard neuf à une équipe qui investit sérieusement dans l'IA
STACK : Python, vLLM, LangGraph, Google ADK, DSPy, Phoenix (Arize), FastAPI, Kubernetes
PROCESSUS DE RECRUTEMENT
1) Test technique Python sur HackerRank. 2) Entretien en présentiel à Paris, incluant des exercices de mathématiques et de code sur table, sans assistance IA. 3) Vérification des références techniques
1) 5 ans d'expérience minimum, dont au moins 3 ans en entreprise sur des sujets agentique, RAG, IA générative
2) Compréhension profonde du fonctionnement des LLMs (architecture transformer, attention, tokenisation, décodage, quantization) - capable de l'expliquer et de le démontrer
3) Expérience concrète de l'inférence en production : vLLM, GPU, optimisation de performances
4) Pratique du fine-tuning (SFT, LoRA/QLoRA) et de l'amélioration de systèmes RAG en production
5) Solides bases en mathématiques et Python (testées en entretien présentiel)
6) Références techniques vérifiables