Pessoa analista de infraestrutura (sre | devops)
Summary
Designs and maintains scalable cloud infrastructure on Google Cloud Platform (GCP), focusing on Kubernetes, Redis, CDN, and observability tools like Prometheus and Grafana.
O que buscamos em você
- Experiência sólida como SRE, DevOps ou Infraestrutura em ambientes de alta complexidade.
- Domínio avançado em Google Cloud Platform (GCP), especialmente Google Kubernetes Engine (GKE).
- Experiência com sistemas de cache (Redis) e CDN.
- Conhecimento avançado em gerenciamento de DNS.
- Experiência com infraestrutura como código (Terraform, Pulumi ou similares).
- Conhecimento em redes, firewalls, segurança e protocolos de comunicação.
- Familiaridade com pipelines de CI/CD.
- Experiência com monitoramento e observabilidade (Prometheus, Grafana, Cloud Monitoring ou similares).
- Conhecimento em Google Cloud Pub/Sub.
- Experiência com Elasticsearch.
- Capacidade de liderar projetos técnicos e apoiar a evolução do time.
- Conhecimento em práticas de FinOps para otimização de custos em cloud.
- Forte capacidade de automação, troubleshooting e melhoria contínua.
Diferenciais que contam pontos
- Certificações em GCP (Professional Cloud Architect, Professional DevOps Engineer ou similares).
- Experiência com Redis em ambientes de alta disponibilidade.
- Vivência em disaster recovery e arquiteturas críticas.
- Experiência com ambientes distribuídos de alta escala.
- Inglês intermediário.
O que valorizamos no dia a dia
- Perfil analítico e foco em resolução de problemas complexos.
- Boa comunicação e colaboração com diferentes áreas.
- Autonomia e senso de responsabilidade.
- Mentalidade de melhoria contínua.
- Capacidade de atuar com visão sistêmica e foco em impacto.
Como você vai contribuir na prática
Infraestrutura cloud e arquitetura escalável
- Projetar, implementar e gerenciar infraestruturas em Google Cloud Platform (GCP), com foco em Google Kubernetes Engine (GKE).
- Garantir ambientes escaláveis, resilientes e preparados para suportar crescimento contínuo.
- Gerenciar capacidade e performance dos sistemas, planejando scaling horizontal e vertical.
Performance, disponibilidade e confiabilidade
- Otimizar sistemas de cache (Redis) e CDN para garantir alta performance e baixa latência.
- Gerenciar e configurar DNS para assegurar disponibilidade e resiliência.
- Atuar em incidentes críticos, conduzindo troubleshooting e análises pós-incidente (post-mortem).
Automação e eficiência operacional
- Desenvolver e manter automações para melhorar a eficiência operacional e reduzir tarefas manuais.
- Liderar iniciativas de automação de deploy, scaling e recuperação de falhas.
- Promover eficiência operacional através da padronização de processos e práticas de SRE.
Observabilidade, mensageria e melhoria contínua
- Garantir observabilidade ponta a ponta utilizando métricas, logs e traces.
- Trabalhar com ferramentas como Prometheus, Grafana e Cloud Monitoring.
- Atuar com sistemas de mensageria como Google Cloud Pub/Sub e soluções de busca e análise como Elasticsearch.
- Identificar oportunidades de otimização de custos em cloud, aplicando práticas de FinOps.