Data Engineer - Python F/H - Système, réseaux, données
Summary
Data Engineer developing, maintaining and industrializing Python ETL pipelines to structure and standardize health data for a hospital's Data Factory, collaborating with scientific and infrastructure teams.
Data Engineer - Python F/H - Système, réseaux, données
Data Engineer - Python F/H - Système, réseaux, données 69 - Lyon 8e Arrondissement
Offre n° 6038207 Data Engineer - Python F/H - Système, réseaux, données
Descriptif du poste:
Dans le cadre d'un remplacement, nous recrutons pour renforcer notre Data Factory : Data Engineer - Python (F/H) - CDI - temps plein - à pourvoir à compter de septembre 2026.
Le CLB est impliqué dans des projets d'intelligence artificielle depuis plusieurs années avec des partenariats académiques et industriels. Ces projets bénéficient de notre importante base de données de plus de 340 000 patients dans un dossier patient développé en interne et qui a été progressivement informatisé depuis 1993.
Depuis quelques années, le CLB s'est engagé dans des projets intégrant l'Intelligence Artificielle (IA) et les Big Data en santé. Les prérequis à l'utilisation des données de santé et l'intégration de l'IA en routine est la disponibilité de données structurées et de qualité. C'est devant cette nécessité que la Data Factory a été créée en 2021, dont les objectifs sont de structurer et fiabiliser les données.
Vous êtes rattaché hiérarchiquement au Directeur des Systèmes d'Information et à la Responsable de la Data Factory, et vous êtes en lien très fort avec les équipes scientifiques, porteuses de projet.
L'équipe Data Factory est une des trois équipes de la DSI avec l'équipe de développement/projet et l'équipe infrastructure.
Elle est dédiée à la mise en œuvre et au pilotage de projets de réutilisation de données massives (Big Data). Elle permet l'extraction et le traitement de données des données de santé à destination des projets de recherche clinique ou des industriels.
Au sein de la Data Factory, vous participez :
- Au développement, à la maintenance, à l'optimisation et à l'industrialisation des ETL, en Python. Ces traitements permettent de structurer, nettoyer et standardiser des données hétérogènes issues de multiples sources (bases de données, fichiers plats, exports spécifiques, etc.) pour les rendre conforme aux standards/ format cible OSIRIS et OSIRIS RWD,des scripts python pour rendre interopérables des systèmes entre eux, manipuler des sources de données spécifiques (DICOM d'imagerie, lames numérisées d'anatomopathologie.),
- A l'automatisation et l'industrialisation des traitements data (ETL, algorithme IA ou brique CI/CD) de l'équipe,
- A la maintenance et l'étoffement de l'outillage interne de l'équipe avec l'appui du architecte logiciel de l'équipe projet,
- Aux réflexions, spécifications, installations et mises à jour des infrastructures / logiciels / architectures spécifiques aux projets de recherche avec l'appui des équipes d'infrastructure.
La mission :
- Réaliser des analyses des structures et format de données,
- Réaliser l'analyse technique (architecture, choix des composants, prototypage, compatibilité avec les technologies existantes) dans le respect des bonnes pratiques d'infrastructure et de cybersécurité
- Contribuer à la documentation,
- Être le relai auprès de l'architecte logiciel sur les aspects développement et outillage,
- Être le relai de l'équipe infrastructure sur les aspects systèmes des projets.
Profil recherché:
PROFIL ET COMPETENCES :
Féru de code, vous avez un attrait pour l'acquisition de compétences et êtes curieux des évolutions techniques dans votre domaine. Vous avez une appétence pour les sujets devops.
Vous saurez également être force de proposition et en mesure de faire évoluer ces propositions, au regard des exigences des équipes qui vous entoure.
Vous êtes doté d'un bon sens relationnel et faites preuve de rigueur, d'organisation et d'autonomie. Vous avez le goût du travail en équipe et communiquez aisément.
Vous avez un intérêt pour la compréhension d'un projet dans son ensemble et savez traduire cela dans la priorisation de vos tâches.
Diplôme et compétences :
- Diplôme d'une grande Ecole d'Ingénieur et/ou d'un 3ème cycle universitaire spécialisé en Informatique.
- 3 ans d'expérience minimum (alternance acceptée), idéalement dans le domaine des data en santé, (dont une année sur les aspects devops) souhaitée.
- Connaissances générales en informatique et en data.
- Connaissance système serveur Windows et Linux.
- Maitrise en développement python (optimisation, refactoring de code.) en contexte big data.
- Bonnes connaissances en industrialisation et automatisation.
- Connaissance des ETL/ELT, construction de pipeline de données et requêtage SQL.
- Connaissance des outils Airflow et GitLab (ou équivalent).
- Capacité à appréhender des enjeux liés à la recherche, à l'analyse de données et aux technologies de machine learning, notamment dans le domaine de la santé (santé publique, génétique, épidémiologie, etc.)
- Niveau anglais technique obligatoire, pour échanger avec les partenaires internationaux.
Sont un plus :
- Connaissance du milieu de la recherche en santé
- Connaissance Docker
Si vous êtes tenté par une expérience où vous allierez épanouissement professionnel et travail "utile", au bénéfice de l'amélioration de la prise en charge de nos patients, alors rejoignez nous !
Rému
Type de contrat CDI
Contrat travail Salaire
- A partir de 40 k€ brut annuel
Expérience
- 3 An(s) Cette expérience est indispensable
Informations complémentaires
- Secteur d'activité : Activités hospitalières
Employeur
Nous rejoindre, c'est :
- Accomplir un travail qui compte et où chacun compte.
- Vivre au quotidien des expériences enrichissantes.
- Travailler avec plaisir au sein d'une communauté à l'ambiance conviviale.
- Construire votre parcours et grandir dans une structure apprenante.
- Concilier « vivre et travailler ».
Au Centre Léon Bérard, nous vous proposons :
- En moyenne, 20 jours de récupération par an (en plus de 5 semaine