Engenheiro de Dados Sênior / Especialista em MLOps
Summary
Designs, optimizes, and maintains large-scale data infrastructure and pipelines on GCP/BigQuery, bridging model development and production while automating CI/CD workflows.
1. Contexto e Missão do Cargo
Estamos em processo de expansão da nossa estrutura de engenharia de dados e procuramos um profissional de perfil técnico, com foco em engenharia de dados avançada e sólidas fundações de DevOps e conhecimento de MLOps. Esta pessoa será responsável por desenhar, otimizar e manter a infraestrutura e os pipelines que sustentam os projetos de data locais, projetos de data science e as operações analíticas da empresa, servindo como uma ponte crítica entre o desenvolvimento de modelos e a produção em larga escala.
2. Principais Responsabilidades e Atividades
● Engenharia de Pipelines Complexos: Desenvolver, monitorizar e automatizar pipelines robustos de ingestão de dados (Batch e Streaming), lidando com cenários complexos como a integração avançada de APIs de fornecedores externos e web scraping de APIs aplicacionais.
● Arquitetura e Convenções de Data Warehouse: Desenhar e organizar o armazenamento de dados no Google BigQuery utilizando boas práticas de modelação. Garantir a correta transição e segregação lógica de ambientes, desde a receção de dados em bruto (Data Swamp / Data Lake) até às camadas otimizadas de disponibilização (Publish Layers).
● Automação e Infraestrutura (CI/CD): garantir o ciclo de vida do código e que as implementações sejam automatizadas.
● Cultura de Engenharia de Software: Contribuir para soluções altamente escaláveis, seguras e devidamente documentadas. Promover e estruturar repositórios modernos em ambiente Monorepo, facilitando a colaboração e a independência das equipas de Data Science.
3. Perfil Técnico e Requisitos do Candidato
Requisitos Mandatórios (Hard Skills)
● Experiência consolidada em Engenharia de Dados ou Engenharia de Software focada em sistemas de dados de larga escala.
● Experiência prática no ecossistema cloud GCP (Google Cloud Platform), com foco especializado em BigQuery.
● Proficiência comprovada no desenho de pipelines automatizados de CI/CD utilizando preferencialmente GitHub Actions (ou ferramentas equivalentes de mercado).
● Sólido entendimento de arquiteturas de dados modernas (Lakehouse, Data Lake) e suas respectivas convenções de camadas de dados.
● Proficiência em Inglês: Nível mínimo de conversação e escrita intermédio-avançado/fluente ( exemplo: B2 ou C1), para comunicação em ambientes técnicos e internacionais.
Requisitos Valorizados (Diferenciais)
● Experiência prática direta em conceitos e ferramentas de MLOps (gestão do ciclo de vida de modelos, serving de APIs de modelos, feature stores).
● Experiência no deployment de soluções em clusters orquestrados (Kubernetes), dependendo da necessidade arquitetural.
● Experiência com Observabilidade Usando Logging como Datadog ou Grafana
● Conhecimentos da metodologia SCRUM e de ferramentas como Jira.
4. Resumo da Stack Tecnológica Solicitada Categoria
Tecnologias / Conceitos Chave
Cloud & Storage
Google Cloud Platform (GCP), Google BigQuery
Infraestrutura & DevOps
Docker, Máquinas Virtuais (VMs)
CI/CD & Repositórios
GitHub Actions
SCRUM
Jira
Arquitetura de Dados
Data Swamp, Data Lake, Publish Layers, Convenções de DW
Idiomas
Inglês (B2 ou C1)