freehire launches on Product Hunt on 26 August.

Follow →

Databricks Data Engineer| Senior | (Remote)

Summary

Senior data engineer rebuilding legacy data warehouse pipelines in Databricks using PySpark/Spark SQL, implementing bronze-silver-gold layers, and migrating ETL rules from legacy tools.

  • Reconstruir os pipelines do DW legado em Databricks (PySpark / Spark SQL), a partir das especificações geradas pela engenharia reversa;
  • Implementar as camadas bronze, silver e gold seguindo o template medalhão, os padrões de ingestão (CDC/batch) e o padrão de reconstrução definidos pelo projeto;
  • Executar as waves de reconstrução por domínio, em coexistência com o DW legado até o cutover;
  • Implementar regras de negócio e transformações com testes automatizados nos pipelines;
  • Realizar a reconciliação e a validação de paridade dos dados entre o DW legado e o Lakehouse;
  • Otimizar performance e custo dos pipelines (particionamento, OPTIMIZE/Z-ORDER, dimensionamento de jobs);
  • Contribuir com a documentação técnica das regras migradas e apoiar a priorização das waves.
  • Experiência sólida com Engenharia de Dados;
  • PySpark e Python avançados: desenvolvimento de pipelines batch em escala, com testes e boas práticas de engenharia;
  • SQL avançado e modelagem de dados: transformações complexas, tuning de performance e modelagem relacional/dimensional em contexto de DW;
  • Databricks e Delta Lake: jobs, workflows e arquitetura medalhão (bronze, silver, gold) em produção; Delta Live Tables / Lakeflow e Asset Bundles;
  • Migração / reconstrução de pipelines ETL: tradução de regras de negócio de ferramentas legadas para Spark (sem lift-and-shift), com ingestão CDC/batch de bancos relacionais;
  • Ecossistema AWS: S3, Glue, EMR, Athena, Lambda, DMS e Step Functions;
  • Azure Synapse: experiência com o ambiente legado (SQL pools e pipelines) para apoiar a engenharia reversa;
  • Qualidade e reconciliação de dados: testes automatizados, DQ gates e comparação legado × novo para aceite de paridade;
  • Git e CI/CD aplicados a pipelines de dados.


Desejáveis:


  • Conhecimento de DataStage (leitura de jobs para engenharia reversa) — diferencial importante;
  • Experiência prévia em programas de migração de DW para lakehouse — diferencial importante;
  • Unity Catalog (permissões, lineage) e contratos de dados;
  • Experiência no mercado financeiro ou de crédito;
  • Certificações Databricks (Data Engineer Associate / Professional).