Engenheiro Cloud & Confiabilidade (SRE) - Pleno
NewBe an early applicantSummary
Mid-level Cloud & Reliability (SRE) engineer at dataRain Consulting in São Paulo, working hybrid (3 days on-site in Brooklin). Day to day: running multi-account AWS environments, incident response and SLAs, building observability dashboards, Terraform IaC and CI/CD pipelines, and executing AWS migrations using AWS, Docker/ECS/EKS, CloudWatch/Grafana/Prometheus and GitHub Actions.
Na DataRain Consulting, a nossa cultura é o coração do nosso sucesso. Somos uma empresa dedicada ao mundo da tecnologia, mas o que nos diferencia é o nosso compromisso com as pessoas. Acreditamos que o verdadeiro valor reside na diversidade de experiências, perspectivas e talentos que cada indivíduo traz para a equipe.
Além disso, valorizamos a experiência em todas as suas formas. Cada projeto é uma oportunidade para aprender e crescer, e cada desafio é uma chance de inovar.
Aqui, somos uma comunidade que valoriza e nutre a aprendizagem constante e a colaboração. Junte-se a nós e faça parte do time de elite da dataRain Consulting
Operação & Sustentação
- Administração de ambientes AWS multi-conta
- Resolução e escalonamento de incidentes;
- Cumprimento de SLAs contratuais
- On-call rotation, quando necessário, participação em war rooms e documentação de runbooks e post-mortems
SRE & Observabilidade
- Definição e implementação de SLIs, SLOs e Error Budgets por cliente
- Dashboards de observabilidade (CloudWatch, Grafana, Prometheus)
- Introdução gradual de chaos engineering
IaC & Automação
- Terraform: modules, workspaces, remote state
- Pipelines CI/CD para infraestrutura (GitHub Actions, CodePipeline)
- Automação operacional: Lambda, SSM Automation, EventBridge; self-healing
Migrações & Modernização
- Execução de migrações AWS (lift-and-shift, re-platform, re-architect)
- Conteinerização de workloads: Docker > ECS/EKS
- AWS Core: EC2, S3, RDS, Lambda, VPC, IAM, CloudWatch, Route 53, ELB/ALB, Auto Scaling, ECS
- IaC: Terraform (modules, workspaces, remote state); Atlantis ou Terragrunt são diferenciais
- Containers: Docker, ECS; EKS/Kubernetes, GitOps com Flux/ArgoCD (desejável)
- CI/CD: GitHub Actions, CodePipeline ou equivalente
- Observabilidade: CloudWatch, Grafana + Prometheus ou Datadog
- Linux: Administracao; scripting Bash; Python
- Networking: VPC design, Transit Gateway, VPN, Route 53 (failover, health checks), Security Groups, NACLs
- Segurança: IAM, SCPs
- FinOps (desejável): Cost Explorer, Right Sizing, Saving Plans
Perfil comportamental:
- Proatividade com responsabilidade (faz o combinado e avisa riscos cedo).
- Curiosidade e vontade de aprender rápido.
- Organização para lidar com demandas simultâneas.
- Mentalidade de melhoria contínua: mede, aprende e ajusta.