Unknown company
Senior DevOps Engineer (SRE)
Summary
Senior DevOps Engineer builds and maintains cloud infrastructure (AWS ECS/EKS, Azure DevOps) and CI/CD pipelines, ensuring scalability, security, and observability for AI model inference workloads.
Sobre a posição
- Padronização e criação de templates IAC (Terraform) e de pipelines (yaml).
- Suporte operacional para times de desenvolvimento. (Pipelines, SAST/DAST)
- Governança de acesso as plataforma e sistemas. (Banco de dados, contas corporativas, etc)
- Monitoramento da observabilidade dos ambientes.
- Projetar, implementar e manter infraestrutura como código (IaC) na AWS, com foco em AWS ECS (Fargate) e Terraform, garantindo reprodutibilidade e versionamento (git) dos ambientes.
- Conhecimento em autenticação e autorização para aplicações (oAuth, etc).
- Operar e evoluir para um clusters Kubernetes (EKS) e ECS com isolamento multi-tenant e multi-region, incluindo gestão de namespaces, políticas de rede, autoscaling e hardening.
- Construir e manter pipelines de CI/CD em Azure DevOps, incluindo gestão de agentes self-hosted em EC2, otimização de custos de paralelização e segurança de repositórios.
- Sustentar a stack de dados atuando junto ao time de dados nos requisitos de infraestrutura, throughput, isolamento e recuperação.
- Implementar e evoluir a stack de observabilidade (Grafana self-hosted, Prometheus, Loki, Jaeger), incluindo alerting multicanal (Microsoft Teams, Telegram, chamadas via Twilio/Lambda) e correlação entre métricas, logs e traces.
- Apoiar o deploy e a operação de cargas de inferência de modelos de IA (ex.: vLLM em ECS/EC2 com GPU, ALB interno, APIs OpenAI-compatíveis), garantindo escalabilidade, custo e disponibilidade.
- Conduzir a migração contínua de cargas da Azure para AWS, priorizando consolidação de fornecedores, redução de custo e simplificação operacional.
- Atuar em segurança e compliance: gestão de identidades via Microsoft Entra ID, segregação de acessos, rotacionamento de secrets, hardening de pipelines e suporte a avaliações de risco de fornecedores (ex.: OneTrust).
- Definir SLOs, error budgets e runbooks; conduzir post-mortems sem culpa e dirigir melhorias estruturais a partir de incidentes.
- Colaborar com engenharia de software e dados na revisão de arquitetura, contribuindo com perspectiva de operabilidade desde o design.
- Documentar decisões arquiteturais (ADRs), diagramas (C4) e procedimentos operacionais.
- Conhecimento e aplicação de práticas finops para provedores de nuvem.
- Conhecimento em GCP, Aikido.
- Conhecimento em infraestrutura e redes on-premises.