freehire launches on Product Hunt on 26 August.

Follow →

SRE SR | Remoto

Open 18d

Summary

Senior Site Reliability Engineer responsible for maintaining and evolving a critical AWS-based platform, ensuring high availability, scalability, and observability using Kubernetes, Terraform, and Datadog.

Quais serão suas principais entregas?

Responsável por garantir que os serviços operem com alta disponibilidade, desempenho, segurança, observabilidade e capacidade de recuperação. Sua atuação deve combinar práticas de engenharia de software voltadas para infraestrutura, automação, gestão de incidentes e melhoria contínua.

Mais do que executar atividades operacionais, espera-se que o profissional identifique riscos sistêmicos, proponha soluções estruturais, automatize processos repetitivos, defina padrões técnicos e lidere a evolução da confiabilidade dos ambientes.

Como será o seu dia a dia?

· Monitorar continuamente a saúde dos ambientes utilizando Datadog e OpenSearch.

· Acompanhar a operação dos clusters Amazon EKS, identificando e resolvendo problemas de infraestrutura.

· Administrar e otimizar containers Docker e repositórios no Amazon ECR.

· Configurar, revisar e manter Nginx, Lua, ALBs e NLBs para garantir disponibilidade e desempenho das aplicações.

· Monitorar e administrar o Amazon MSK, acompanhando filas, brokers, tópicos e consumer lag.

· Gerenciar pipelines de logs com Fluent Bit, Fluentd e Logstash.

· Provisionar, revisar e evoluir infraestrutura utilizando Terraform.

· Automatizar configurações e tarefas operacionais com Ansible.

· Investigar incidentes, realizar troubleshooting e executar ações de mitigação e recuperação.

· Criar e manter dashboards, alertas, métricas e SLOs para acompanhamento da plataforma.

· Planejar melhorias de capacidade, desempenho, segurança e redução de custos.

· Trabalhar em conjunto com os times de desenvolvimento para garantir entregas confiáveis, escaláveis e observáveis.

Conhecimentos que estamos buscando:

  • Vivência em ambiente de desenvolvimento ágil;
  • Conhecimento de uso com o JIRA e CONFLUENCE;
  • Possuir perfil analítico, proativo e participativo, com habilidade de solucionar problemas e boa adaptabilidade nas mudanças;
  • Possuir comunicação para interagir diretamente com sua equipe e pessoas de outros times;
  • Disposição para colaborar com o crescimento das pessoas de seu convívio, querendo impactar suas carreiras profissionais;
  • Profissional autogerenciável e comprometido/a com o todo, buscando entender o produto, tirando dúvidas e trazendo soluções.
  • Estar sempre estudando e atualizado em novas tecnologias buscando o aperfeiçoamento contínuo;
  • Experiência sólida com Docker, incluindo criação, otimização e gerenciamento de imagens e containers.
  • Conhecimento em Kubernetes, preferencialmente Amazon EKS, com experiência em administração, troubleshooting e escalabilidade de clusters.
  • Experiência com Terraform para provisionamento e gerenciamento de infraestrutura como código (IaC).
  • Conhecimento em Ansible para automação de configurações, deploys e padronização de ambientes.
  • Experiência na administração e configuração de Nginx, incluindo proxy reverso, balanceamento de carga, SSL/TLS e otimização de desempenho.
  • Conhecimento em Lua para customizações e automações em ambientes Nginx/OpenResty.
  • Experiência com Amazon ECR (AWS Registry) para gerenciamento de imagens Docker e versionamento de containers.
  • Conhecimento em Application Load Balancer (ALB) e Network Load Balancer (NLB) para gerenciamento de tráfego e alta disponibilidade.
  • Experiência com Amazon MSK (Kafka), incluindo monitoramento de brokers, tópicos, consumer groups e análise de consumer lag.
  • Conhecimento em pipelines de logs utilizando Fluent Bit, Fluentd e Logstash, incluindo coleta, transformação e envio de logs.
  • Experiência com Datadog para observabilidade, criação de dashboards, métricas, logs, traces, APM e alertas.
  • Conhecimento em OpenSearch para indexação, consulta e análise de logs e dados operacionais.
  • Experiência em monitoramento, troubleshooting e resolução de incidentes em ambientes críticos.
  • Conhecimento em boas práticas de alta disponibilidade, escalabilidade, segurança, observabilidade e automação.
  • Vivência com metodologias DevOps, SRE, Infraestrutura como Código (IaC) e cultura de melhoria contínua.
  • Conhecimento em ambientes AWS e seus principais serviços relacionados à plataforma de containers e infraestrutura.

Desejável conhecimento em:

  • Docker – Criação, otimização e gerenciamento de imagens e containers
  • Nginx – Configuração de proxy reverso, roteamento, balanceamento de carga, SSL/TLS e otimização de desempen
  • Lua – Desenvolvimento e manutenção de scripts para customização e automação em Nginx/OpenResty.
  • Fluent Bit / Fluentd – Coleta, processamento, enriquecimento e encaminhamento de logs.
  • Logstash – Construção e manutenção de pipelines para transformação, filtragem e distribuição de logs.
  • AWS Cloud – Experiência com arquitetura, redes, segurança, disponibilidade, escalabilidade, monitoramento e otimização de custos na AWS.
  • Amazon MSK (Kafka) – Administração e monitoramento de clusters Kafka, brokers, tópicos, partições, consumer groups e consumer lag.
  • Amazon ECR (AWS Registry) – Gerenciamento, versionamento, armazenamento e análise de segurança de imagens Docker.
  • Amazon EKS (Kubernetes) – Administração de clusters, deployments, autoscaling, segurança, alta disponibilidade e troubleshooting.
  • Application Load Balancer (ALB) – Configuração de listeners, target groups, health checks e roteamento de tráfego HTTP/HTTPS.
  • Network Load Balancer (NLB) – Configuração de balanceamento de tráfego TCP, UDP e TLS, com foco em desempenho e disponibilidade.
  • Datadog – Monitoramento de infraestrutura e aplicações por meio de métricas, logs, traces, APM, dashboards e alertas.
  • OpenSearch – Indexação, pesquisa, análise, retenção e visualização de logs e dados operacionais.
  • F5 BIG-IP – Administração de Virtual Servers, Pools, Monitors, iRules, balanceamento de carga, SSL Offloading e alta disponibilidade.
  • Ansible – Automação de configurações, instalações, atualizações e padronização de ambientes.
  • Terraform – Provisionamento e gerenciamento de infraestrutura como código, com módulos reutilizáveis, controle de estado e automação de ambientes AWS.

See also