Data Engineer GCP / Hadoop / PySpark (H/F)
Summary
Develop and maintain PySpark pipelines and data ingestion flows for a client's Data Lake using GCP and Hadoop in an Agile environment.
À propos d’AMI Consulting
Entreprise innovante & familiale – Lauréat de la bourse Innov'UP de BPI France en 2019, AMI Consulting est spécialisé dans l’exploitation de la data afin de proposer des consultants experts parfaitement adaptés aux besoins de ses clients.
Engagement durable & bien-être – Nous valorisons la qualité de vie de nos collaborateurs et adoptons une approche 100 % digitale pour la qualification, la sélection et l’intégration de nos talents, réduisant ainsi notre empreinte carbone.
Présentation de l'offre
Localisation : Île-de-France
Secteur : Data / Big Data / Cloud
Télétravail : Hybride – 1 jour de télétravail par semaine
Contrat : CDI de mission ou Freelance via portage salarial
CDI de mission : 50 k€ brut annuel
Freelance : TJM 480 € HT – uniquement via société de portage
Expérience : 5 ans minimum
- Français : Courant
- Anglais : Professionnel – échanges avec des équipes internationales
Contexte de la mission
Au sein de la DSI de notre client, en charge de la conception et de la maintenance des applications stratégiques des métiers du Groupe, nous recherchons un Data Engineer GCP / Hadoop / PySpark.
La mission s’inscrit dans le cadre de l’évolution du Data Lake CIO Office.
Le consultant participera au développement, à l’évolution et à l’industrialisation des pipelines de données, en collaboration avec les équipes de production applicative et DevOps.
Vous évoluerez dans un environnement Big Data, Cloud et Agile, avec des interactions régulières avec des équipes internationales.
Responsabilités
- Concevoir et développer de nouveaux flux d’ingestion de données
- Développer et maintenir les pipelines Data en PySpark
- Réaliser les traitements de préparation, transformation et intégration des données
- Participer à l’évolution du Data Lake et des traitements Big Data
- Développer et maintenir des scripts Shell
- Collaborer avec les équipes DevOps sur les évolutions de la plateforme
- Rédiger les spécifications techniques
- Participer aux tests, validations et mises en production
- Optimiser les traitements et les performances des pipelines
- Participer aux cérémonies Agile et aux échanges avec les équipes internationales
Compétences techniques
- GCP
- Hadoop
- PySpark / Spark
- Shell Scripting
- Data Lake
- Big Data / Data Engineering
Profil recherché
- Expérience confirmée en tant que Data Engineer
- Excellente maîtrise de PySpark / Apache Spark
- Expérience significative sur des environnements Hadoop / Big Data
- Bonne connaissance des environnements GCP