Data Engineer
Summary
The Data Engineer will design, develop, and maintain ETL/ELT data pipelines on Google Cloud Platform. The role involves working with technologies like Python, Spark, BigQuery, and Airflow to build scalable data architectures.
¡Sé parte de Stefanini!
En Stefanini somos más de 30.000 genios, conectados desde 41 países, haciendo lo que les apasiona y co-creando un futuro mejor.
- Diseñar, desarrollar y mantener pipelines de datos ETL/ELT, tanto batch como event-driven.
- Implementar soluciones de procesamiento y almacenamiento sobre Google Cloud Platform.
- Desarrollar procesos utilizando Python, SQL y Spark/PySpark.
- Trabajar con servicios como BigQuery, Cloud Storage, Dataflow, Dataproc y Pub/Sub.
- Implementar y mantener procesos de orquestación mediante Airflow / Cloud Composer.
- Participar en la construcción y evolución de arquitecturas Data Lake, Data Warehouse y/o Lakehouse.
- Diseñar y optimizar modelos de datos para procesamiento y explotación de información.
- Automatizar procesos y despliegues mediante prácticas de CI/CD e Infrastructure as Code, idealmente utilizando Terraform.
- Implementar controles que aseguren la calidad, integridad, trazabilidad y disponibilidad de los datos.
- Optimizar pipelines, consultas y procesos considerando performance, escalabilidad y uso eficiente de recursos.
- Participar en procesos de migración y modernización de plataformas de datos hacia Cloud.
- Colaborar con equipos de Arquitectura, Data Science, BI, Desarrollo y áreas de negocio.
- Documentar arquitecturas, pipelines, modelos y soluciones implementadas.
- Apoyar técnicamente al equipo y promover buenas prácticas de Ingeniería de Datos.
Stack principal:
- Google Cloud Platform (GCP).
- BigQuery.
- Cloud Storage.
- Dataflow y/o Dataproc.
- Pub/Sub.
- Python.
- SQL avanzado.
- Apache Spark / PySpark.
- Desarrollo de pipelines ETL/ELT.
- Modelamiento y transformación de datos.
- Airflow / Cloud Composer para orquestación.
Conocimientos deseables:
- DBT y/o Dataform.
- Terraform.
- Git y procesos CI/CD.
- Data Lake / Data Warehouse / Lakehouse.
- Hadoop y/o Kafka.
- Bases de datos relacionales y NoSQL.
- Machine Learning y/o Vertex AI.
- Gobierno y calidad de datos.
Beneficios Stefanini