Data Engineer (Databricks) | Specialist (Remoto)
- Construção e manutenção de pipelines de dados escaláveis e confiáveis, utilizando tecnologias modernas de processamento distribuído para garantir a ingestão, transformação e disponibilização de dados com qualidade e performance.
- Organização das tabelas em Delta Lake e Unity Catalog;
- Implementação de uma esteira automatizada de MLOps nativa em Databricks on GCP, cobrindo o ciclo de vida completo dos modelos;
- Preparação de dados, geração de features, treinamento, validação, registro, deploy, serving, monitoramento e retreino automático;
- Atuação desde o discovery técnico com inventário dos modelos existentes, até a construção de um template padrão de pipeline validado em um piloto e migração progressiva dos modelos em ondas organizadas por criticidade.
- Atuação no modelo ágil, com sprints, rituais de refinamento, review e retrospectiva;
- Experiência com Databricks;
- Experiência com PySpark e Apache Spark;
- Experiência com Apache Airflow;
- Experiência com BigQuery;
- Experiência com integração e utilização do MLflow;
- Conhecimento em AWS Glue;
- Experiência com bancos de dados SQL e NoSQL, como PostgreSQL, MongoDB e Cassandra;
Requisitos Desejáveis:
- Desejável conhecimento em Apache Kafka;
- Desejável conhecimento em dbt.