Site Reliability Engineering (SRE) Sênior

Open 35d reposted 2× · 2 open copies

Sobre a Oportunidade

Estamos em busca de um(a) Analista SRE Sênior para integrar o time de SRE/Plataforma e atuar na operação e evolução da nossa infraestrutura híbrida (AWS multi-conta e datacenter on-premises), sustentando plataformas críticas de um grupo regulado (BACEN/CVM/LGPD), com foco em confiabilidade, segurança, automação e eficiência de custos.

Responsabilidades:

  • Operar e evoluir o ambiente AWS multi-conta (Control Tower) e clusters Kubernetes/EKS que hospedam centenas de microserviços.
  • Sustentar deploys via GitOps (ArgoCD + Helm) e evoluir esteiras CI/CD padronizadas (GitHub Actions / GitLab CI) com gates de segurança (secret scanning, SCA, containers, IaC).
  • Infraestrutura como código com Terraform/Terragrunt e automação self-service de provisionamento.
  • Observabilidade de ponta a ponta: Datadog (APM), Prometheus/Grafana, OpenSearch e OpenTelemetry — SLIs/SLOs, dashboards e alertas.
  • Atuar em resposta a incidentes e conduzir post-mortems blameless; participar do processo de gestão de mudanças (GMUD).
  • Aplicar FinOps com metas ativas: análise de custos, reservas/Savings Plans, rightsizing e desligamento de não-produção.
  • Usar IA aplicada (Claude Code, Copilot) para automação, scripts, IaC e documentação.
  • Documentar runbooks/arquitetura e reduzir toil com automação.

Requisitos:

  • Experiência comprovada como SRE/DevOps em ambientes críticos.
  • Experiência comprovada como SRE/DevOps em ambientes críticos.
  • Kubernetes sólido (EKS): Helm, troubleshooting de workloads, probes/autoscaling, ingress.
  • GitOps com ArgoCD e CI/CD (GitHub Actions e/ou GitLab CI).
  • Terraform/Terragrunt: módulos, state remoto, múltiplas contas.
  • AWS: EC2, RDS/Aurora, S3, IAM, VPC/Transit Gateway, Lambda, CloudWatch.
  • Observabilidade: Datadog e/ou Prometheus/Grafana; logs centralizados (OpenSearch/ELK).
  • Bancos de dados em operação: SQL Server, MongoDB/DocumentDB, PostgreSQL.
  • Ambientes on-premises: Linux e Windows Server, virtualização (Nutanix/VMware), balanceamento (F5 ou similar).
  • Scripting: Bash, Python ou PowerShell.
  • IA aplicada a SRE (Claude, ChatGPT, Copilot) para scripts e IaC.
  • FinOps: reservas, Savings Plans, rightsizing e melhores práticas de gerenciamento de custos em nuvem.
  • Excelentes habilidades de comunicação e documentação; colaboração em ambiente ágil e dinâmico.

Diferenciais:

  • Experiência com ambientes regulados do mercado financeiro (BACEN/CVM/LGPD) e missão crítica 24×7.
  • Segurança de plataforma: AWS Secrets Manager/External Secrets, OIDC em pipelines, hardening de clusters.
  • Karpenter/otimização de capacidade; migração VM→Kubernetes.
  • Conhecimento em linguagens de programação (Java, .NET, Node) e arquitetura de sistemas.