Ingeniero de datos - Python Expert
Summary
Builds and maintains scalable Python-based data pipelines and ETL/ELT processes to ingest, transform, and load data from multiple sources, ensuring quality and availability.
Responsabilidades
- Diseñar, desarrollar y mantener pipelines de datos escalables y eficientes utilizando Python.
- Construir, automatizar y optimizar procesos ETL/ELT usan Python para la ingesta, transformación y carga de datos desde múltiples fuentes.
- Desarrollar soluciones de procesamiento de datos mediante librerías como Pandas, NumPy y PySpark.
- Garantizar la calidad, consistencia, trazabilidad, monitoreo y disponibilidad de los datos.
- Implementar validaciones y controles de calidad sobre los flujos de información.
- Procesar grandes volúmenes de datos estructurados y no estructurados mediante Python.
- Diseñar e integrar soluciones mediante APIs REST, servicios web y conectores de datos, con Python.
- Colaborar con equipos de analítica, ciencia de datos, desarrollo y negocio para traducir requerimientos en soluciones técnicas.
- Participar en la definición e implementación de arquitecturas de datos sobre entornos cloud.
- Apoyarse en herramientas de IA Generativa, Copilot y agentes inteligentes para acelerar el desarrollo, documentación y resolución de incidentes.
- Documentar desarrollos, procesos, flujos de datos y buenas prácticas de ingeniería.
- Interactuar directamente con clientes, entendiendo necesidades de negocio y proponiendo soluciones tecnológicas de valor.
- Realizar optimización y monitoreo continuo del rendimiento de procesos y pipelines de datos.
Requisitos Técnicos
- Experiencia sólida desarrollando soluciones de datos con Python.
- Dominio de librerías para procesamiento y análisis de datos como Pandas, NumPy y PySpark.
- Experiencia en desarrollo de procesos ETL/ELT y automatización de flujos de datos.
- Conocimiento avanzado de SQL para consultas, transformaciones y optimización de rendimiento.
- Experiencia con bases de datos relacionales y no relacionales (PostgreSQL, MySQL, SQL Server, MongoDB, DynamoDB u otras).
- Experiencia práctica con Apache Spark y PySpark para procesamiento distribuido de datos.
- Conocimientos en transformación, limpieza, validación y enriquecimiento de datos.
- Familiaridad con herramientas de orquestación y transformación como Apache Airflow, DBT, AWS Glue o similares.
- Entendimiento de arquitecturas Data Lake, Lakehouse y Data Warehouse.
- Experiencia trabajando con servicios cloud, preferiblemente AWS (S3, Glue, Lambda, Athena, EMR, Redshift) o equivalentes en Azure/GCP.
- Conocimiento en integración de sistemas mediante APIs REST y manejo de formatos JSON, CSV, Parquet y Avro.
- Manejo de Git/GitHub/GitLab y aplicación de buenas prácticas de desarrollo y versionamiento.
- Conocimiento de pruebas unitarias y aseguramiento de calidad para desarrollos Python.
- Experiencia en ambientes Linux y gestión de entornos virtuales de Python.
- Conocimiento deseable en Docker y despliegue de aplicaciones orientadas a datos.
- Experiencia utilizando herramientas de automatización, observabilidad y monitoreo de procesos de datos.
- Conocimientos en Control M y Data X (deseable).
Competencias Profesionales
- Alta capacidad analítica y orientación a la calidad de los datos.
- Pensamiento lógico y habilidades avanzadas de resolución de problemas.
- Comunicación clara y efectiva con equipos técnicos y usuarios de negocio.
- Experiencia en levantamiento de requerimientos y relacionamiento con clientes.
- Capacidad para trabajar en equipos multidisciplinarios.
- Proactividad y orientación a la mejora continua.
- Autonomía, organización y responsabilidad en la entrega de resultados.
- Adaptabilidad a nuevas tecnologías y entornos dinámicos.
- Mentalidad de automatización y optimización de procesos.