GCP Data Engineer: PySpark & dbt for Scalable Pipelines
Summary
A GCP data engineer who designs, develops, and industrializes large-scale batch and streaming data pipelines on a cloud data platform, using PySpark, Python, SQL, and dbt, working with BigQuery, Dataproc, Cloud Storage, and Airflow/Composer, plus Spark/query optimization, CI/CD, and data quality work.
DATAMED RESEARCH recherche un Data Engineer GCP pour concevoir, développer et industrialiser des pipelines de données à grande échelle sur une plateforme Data Cloud. Vous travaillerez sur des flux batch et streaming avec PySpark, Python et SQL, et utiliserez dbt pour la modélisation des données.
Vous exploiterez BigQuery, Dataproc, Cloud Storage et Airflow/Composer, optimiserez Spark et les requêtes, et participerez à l'architecture Data tout en assurant CI/CD et des contrôles qualité.