AWS Data Engineer
Summary
Data Engineer with 3+ years of experience who builds and maintains ETL/ELT data pipelines on AWS (S3, Glue, Redshift, Athena, Lambda, Step Functions) using Python, PySpark and SQL. Day to day involves pipeline development and troubleshooting, data quality validation and monitoring, code reviews, and CI/CD practices within agile teams.
No solo buscamos talento, buscamos mentes curiosas que disfruten aprender y transformar el futuro.
Somos tech, somos exigentes y sí, vamos rápido. Pero nadie compite solo. Trabajamos en equipo y si buscas retos que te saquen de la zona cómoda (porque ahí no crece nadie), estás en el lugar correcto. Aquí aprenderás con expertos, participarás en proyectos de alto impacto y estarás siempre un paso adelante en tecnología.
Buscamos un Data Engineer con más de 3 años de experiencia en el desarrollo y mantenimiento de pipelines de datos en entornos cloud (AWS). El candidato será responsable de construir procesos ETL/ELT robustos, aplicar buenas prácticas de calidad de datos y colaborar con el equipo técnico para asegurar que la información esté disponible, limpia y optimizada para los productos analíticos.
1. Experiencia y Requisitos Generales
Experiencia Profesional: 3+ años de experiencia profesional trabajando como Data Engineer, construyendo y operando data pipelines en la nube con volúmenes de datos medianos y grandes.
Trabajo en Equipo: Experiencia colaborando en equipos multidisciplinarios bajo metodologías ágiles y capacidad para entender requerimientos técnicos brindados por arquitectos o líderes de equipo.
Idiomas: Inglés Intermedio (capacidad para leer documentación técnica y participar en comunicaciones escritas/reuniones de equipo).
2. Hard Skills (Competencias Técnicas)
1) Servicios AWS y Conceptos de Data Mesh
Descripción: Manejo práctico de servicios de almacenamiento, cómputo y bases de datos en AWS, interactuando con arquitecturas orientadas a productos de datos.
Nivel Mínimo: Experiencia operativa y de desarrollo en AWS usando Amazon S3, AWS Glue, Amazon Redshift, Athena, AWS Lambda y Step Functions.
Nivel Ideal: Capacidad para desplegar y configurar componentes de datos en AWS siguiendo las arquitecturas y patrones definidos por el equipo.
Nivel Ideal Plus: Familiaridad con conceptos de Data Mesh, uso de AWS Lake Formation y nociones de optimización de costos en la nube.
2) Data Pipelines y Procesamiento Distribuido
Descripción: Construcción, orquestación y monitoreo de data pipelines (ETL/ELT) para la ingestión, transformación y carga de datos.
Nivel Mínimo: Experiencia creando pipelines productivos con procesos batch e incrementales, manejo de dependencias y control de errores.
Nivel Ideal: Dominio de Python y PySpark/Spark para transformaciones distribuidas; experiencia con AWS Glue o EMR, manejo de particiones y reintentos.
Nivel Ideal Plus: Experiencia optimizando el rendimiento de jobs en Spark y consumo en pipelines near real-time o guiados por eventos (event-driven).
3) SQL Avanzado y Consultas
Descripción: Escritura y optimización de consultas SQL para transformación, validación y análisis de datos.
Nivel Mínimo: Dominio de SQL intermedio-avanzado (joins, CTEs, window functions, agregaciones) y experiencia trabajando con Amazon Redshift u otros data warehouses.
Nivel Ideal: Habilidad para diagnosticar consultas lentas, entender planes de ejecución simples y aplicar buenas prácticas de modelado y particionamiento.
Nivel Ideal Plus: Optimización activa de sort/distribution keys en Redshift y sintonización de consultas para reducción de tiempos de ejecución.
4) Data Quality y Monitoreo
Descripción: Implementación de validaciones y controles para garantizar la calidad y consistencia de la información en los pipelines.
Nivel Mínimo: Experiencia aplicando reglas de validación de calidad de datos (duplicados, nulos, formatos) dentro de los flujos de transformación.
Nivel Ideal: Implementación de alertas automatizadas y registro de métricas de calidad para la detección oportuna de fallos.
Nivel Ideal Plus: Uso e integración de frameworks de Data Quality (ej. Great Expectations, Deequ) y seguimiento de linaje de datos.
5) GitHub y Prácticas de Desarrollo (CI/CD)
Descripción: Aplicación de buenas prácticas de desarrollo de software para el control de versiones y despliegue de código.
Nivel Mínimo: Manejo cotidiano de Git/GitHub (branching, pull requests, resolución de conflictos) y documentación de código.
Nivel Ideal: Participación activa en revisiones de código (code reviews) e integración de pipelines de datos en flujos básicos de CI/CD.
Nivel Ideal Plus: Creación y mantenimiento de scripts de automatización para pruebas y despliegues en distintos ambientes (Dev/QA/Prod).4. Responsabilidades Principales
Desarrollo de Pipelines: Construir, probar y mantener pipelines ETL/ELT en AWS utilizando Python, PySpark y SQL.
Transformación y Optimización: Implementar transformaciones de datos eficientes asegurando el correcto particionamiento y manejo de errores.
Calidad de Datos: Aplicar reglas de validación y monitoreo para asegurar la integridad y exactitud de las tablas y Data Products.
Mantenimiento y Soporte: Investigar y resolver fallos o incidencias en los pipelines de producción de manera oportuna.
Buenas Prácticas: Versionar el código en GitHub, participar en revisiones de código y documentar los flujos desarrollados.
Colaboración: Trabajar de la mano con analistas de datos, científicos de datos y arquitectos para entender las necesidades de integración.
¿Qué tenemos para ti?
Apoyamos tu crecimiento personal y profesional con planes de desarrollo individual, donde tu eres dueñ@ de tu carrera y hasta dónde quieres llegar.
Días de descanso superiores a los de la ley: No es necesario esperar un año para disfrutar de tus días de vacaiones, además de días adicionales por tipos de eventos especiales y festividades.
Beneficios económicos adicionales a tu salario: Vales de despensa, fondo de ahorro, bolsa de capacitación, bono de bienestar, convenios y descuentos.
Apoyo emocional, queremos tu estabilidad en salud fisica y mental, por ello tenemos diversos beneficios que cubren aspectos de equilibrio personal para ti y salud para tu familia. ¡Queremos cuidar de ti y los tuyos!
Aquí hay espacio para gente buena… como tú, ¡Queremos conocerte!