Analista de SRE PL
Summary
The SRE Analyst will ensure system availability, scalability, and reliability by monitoring infrastructure, automating operational tasks, and managing incidents. The role involves working with AWS, Azure, Kubernetes, and observability tools like Datadog to optimize performance and support continuous improvement.
Responsável por executar processos de SRE – Site Reliability Engineering (Engenharia de Confiabilidade de Site), visando garantir a disponibilidade, escalabilidade e confiabilidade dos sistemas de tecnologia da empresa.
Principais Atribuições
- Monitorar, analisar e otimizar sistemas, aplicações, infraestrutura e plataformas corporativas.
- Atuar na identificação, diagnóstico e resolução de incidentes, contribuindo para a redução do MTTR e aumento da disponibilidade dos serviços.
- Apoiar a definição e acompanhamento de indicadores de confiabilidade, disponibilidade e desempenho (SLI, SLO e SLA).
- Desenvolver automações para reduzir atividades operacionais manuais e aumentar a eficiência dos ambientes.
- Identificar gargalos de performance, capacidade e escalabilidade, propondo melhorias contínuas.
- Participar de análises de causa raiz (RCA), acompanhando ações corretivas e preventivas.
- Colaborar com as equipes de Desenvolvimento, Infraestrutura, Arquitetura, Segurança da Informação, Banco de Dados e Dados para garantir a confiabilidade das soluções.
- Apoiar a implementação e evolução de arquiteturas em AWS, Azure e Kubernetes.
- Contribuir para processos de backup, recuperação de desastres e continuidade dos serviços.
- Documentar processos, procedimentos e soluções técnicas.
- Disseminar conhecimento técnico e apoiar o desenvolvimento da equipe.
Requisitos Obrigatórios
- Ensino superior completo ou em andamento em Tecnologia da Informação, Ciência da Computação, Engenharia de Software ou áreas correlatas.
- Experiência em operações, infraestrutura, cloud, observabilidade ou SRE.
- Conhecimento em Amazon Web Services (AWS) e Microsoft Azure.
- Conhecimento em Datadog (APM, Logs, Dashboards, Monitors e Synthetics).
- Conhecimento em Zabbix e AWS CloudWatch.
- Conhecimento em observabilidade, métricas, logs e traces.
- Conhecimento em Kubernetes e Docker.
- Conhecimento em Azure DevOps, Git e pipelines de CI/CD.
- Conhecimento em Linux e Windows.
- Conhecimento em redes, DNS, balanceadores de carga e APIs.
- Conhecimento em automação utilizando PowerShell, Bash ou Python.
- Conhecimento em gestão de incidentes e análise de causa raiz.
- Conhecimento em metodologias ágeis.
Diferenciais
- Experiência com Terraform e Infraestrutura como Código (IaC).
- Experiência com Kong ou outras soluções de API Gateway.
- Experiência com Kafka e plataformas de mensageria.
- Vivência com práticas de SRE Cultura FINOPS, Error Budget, SLI, SLO e SLA.
- Experiência em ambientes críticos e de alta disponibilidade.
Ferramentas e Tecnologias Utilizadas no Ambiente
- AWS
- Microsoft Azure
- Datadog
- Zabbix
- AWS CloudWatch
- Kubernetes
- Docker
- Azure DevOps
- Git
- Cloudflare
- Kong API Gateway
- Linux e Windows Server
- PowerShell, Bash e Python
- Observabilidade (APM, Logs, Traces, Métricas e Synthetics)
Benefícios:
-
- VR (R$ 1.042,60 / mês);
- VA (R$ 805,80 / mês);
- Plano de Saúde SulAmérica Apartamento;
- Plano Odontológico SulAmérica;
- PLR;
- Vale Cesta de Natal Alelo R$ 805,80;
- Seguro de vida;
- Auxílio creche ou Babá (R$ 522,38 até 6 anos);
- Licença maternidade de 6 meses e paternidade de 20 dias;
- Day off no dia do seu aniversário;
- Antecipação do 13º no mês de maio;
- TotalPass;
- Modelo de trabalho: Remoto
- Modelo de contratação: CLT
- Local: Belo Horizonte/MG
Todas as nossas vagas são inclusivas a Pessoas com Deficiência (PCD) e todas as diversidades.