freehire launches on Product Hunt on 26 August.

Follow →

9D0A: Engenheiro de Infraestrutura Sênior — AWS e Kubernetes

Open 22d
This position is no longer accepting applications(closed Aug 16, 2026).

Missão da posição

Responsabilidades
Administração e evolução da AWS
  •  Administrar os ambientes de desenvolvimento, homologação e produção na AWS.
  •  Manter e evoluir recursos de computação, rede, armazenamento, banco de dados, cache, filas e segurança.
  •  Avaliar arquiteturas existentes e propor melhorias de disponibilidade, escalabilidade, segurança e custo.
  •  Identificar recursos ociosos, superdimensionados, mal configurados ou sem monitoramento.
  •  Planejar mudanças de infraestrutura com análise de impacto e estratégia de rollback.
  •  Garantir a padronização dos ambientes.
  •  Apoiar a criação e evolução de arquiteturas para novas aplicações e microsserviços.
  •  Documentar topologias, dependências, configurações e procedimentos operacionais.
  •  Atuar na sustentação de ambientes críticos e na resolução de incidentes.
Kubernetes e containers
  •  Liderar tecnicamente a implementação e evolução do Kubernetes na Hero.
  •  Participar do desenho, implantação e operação de clusters Amazon EKS.
  •  Planejar a migração gradual de aplicações executadas em ECS e Fargate para Kubernetes.
  •  Definir padrões para deployments, services, ingress, secrets, config maps, jobs e cron jobs.
  •  Criar e revisar manifestos Kubernetes e charts Helm.
  •  Definir padrões de namespaces, permissões, isolamento e organização dos clusters.
  •  Configurar requests, limits, autoscaling, readiness probes e liveness probes.
  •  Definir estratégias de rolling update, rollback, blue-green e canary deployment quando aplicável.
  •  Investigar pods com falhas, reinícios, problemas de memória, CPU, rede, DNS ou dependências.
  •  Gerenciar imagens Docker e repositórios no Amazon ECR.
  •  Revisar Dockerfiles quanto a segurança, tamanho, desempenho e boas práticas.
  •  Apoiar desenvolvedores na adequação de aplicações para execução em containers.

Redes e conectividade
  •  Administrar VPCs, subnets públicas e privadas, tabelas de rotas, gateways e NAT Gateways.
  •  Criar e revisar Security Groups e Network ACLs.
  •  Configurar conectividade segura entre aplicações, bancos, caches e serviços internos.
  •  Implementar restrições e liberações de acesso por IP.
  •  Administrar acessos por VPN e redes privadas.
  •  Apoiar integrações que exijam IP fixo de saída ou inclusão em listas de IP permitidos.
  •  Diagnosticar problemas de rede, DNS, rotas, portas, latência e resolução de nomes.
  •  Administrar Route 53, certificados digitais e AWS Certificate Manager.
  •  Configurar e revisar Application Load Balancers e Network Load Balancers.
  •  Garantir que bancos de dados, caches e serviços internos não sejam expostos desnecessariamente à internet.
  •  Avaliar conectividade entre regiões, contas e redes externas.

Segurança de infraestrutura
  •  Aplicar o princípio do menor privilégio em usuários, grupos, roles e policies do IAM.
  •  Revisar acessos humanos, acessos de aplicações e permissões concedidas a pipelines.
  •  Estruturar e revisar políticas de acesso aos ambientes de produção.
  •  Gerenciar segredos por meio do AWS Secrets Manager.
  •  Administrar chaves e criptografia utilizando AWS KMS.
  •  Garantir criptografia de dados em trânsito e em repouso.
  •  Configurar e revisar regras no AWS WAF.
  •  Analisar trilhas de auditoria no AWS CloudTrail.
  •  Identificar recursos públicos, portas abertas e configurações inseguras.
  •  Apoiar a rotação de credenciais, chaves, tokens e certificados.
  •  Participar da investigação de incidentes de segurança.
  •  Implementar controles para evitar alterações manuais não rastreadas.
  •  Apoiar requisitos relacionados à LGPD, governança e proteção de dados.
  •  Manter sistemas operacionais, imagens e componentes de infraestrutura atualizados.

Infraestrutura como código
  •  Criar e manter infraestrutura utilizando Terraform ou CloudFormation.
  •  Priorizar o Terraform como ferramenta de padronização e evolução do ambiente.
  •  Estruturar módulos reutilizáveis.
  •  Organizar estados, ambientes e variáveis de forma segura.
  •  Implementar validações, revisões e planos antes da aplicação de mudanças.
  •  Evitar criação manual de recursos sem rastreabilidade.
  •  Manter a infraestrutura versionada em Git.
  •  Criar padrões para desenvolvimento, homologação e produção.
  •  Documentar procedimentos de execução, rollback e recuperação do estado.
  •  Apoiar a implementação de políticas e controles automatizados sobre a infraestrutura.

Observabilidade e monitoramento
  •  Configurar e evoluir o Amazon CloudWatch.
  •  Criar dashboards técnicos e operacionais.
  •  Configurar métricas, logs, alarms e filters.
  •  Centralizar logs de aplicações, containers, load balancers e serviços AWS.
  •  Criar alertas para indisponibilidade, erros, latência e saturação.
  •  Monitorar CPU, memória, storage, rede, conexões, filas e health checks.
  •  Definir retenção adequada de logs, equilibrando necessidade operacional e custo.
  •  Criar alertas que sejam acionáveis e possuam responsáveis definidos.
  •  Apoiar a definição de indicadores de disponibilidade e desempenho.
  •  Investigar aumentos inesperados no volume de logs ou nos custos de observabilidade.
  •  Desenvolver runbooks para resposta a alertas e incidentes recorrentes.
  •  Avaliar a adoção de Prometheus, Grafana e OpenTelemetry quando necessário.

Gestão e otimização de custos AWS
  •  Analisar continuamente os custos da infraestrutura.
  •  Identificar anomalias de consumo e aumentos inesperados.
  •  Avaliar custos de EC2, ECS, EKS, RDS, ElastiCache, Load Balancers, VPC, CloudWatch e Data Transfer.
  •  Realizar rightsizing de instâncias, bancos e containers.
  •  Analisar a adoção de Savings Plans e Reserved Instances.
  •  Revisar custos de NAT Gateway, transferência de dados e tráfego entre regiões.
  •  Revisar retenção de logs, snapshots, volumes, imagens e arquivos.
  •  Criar rotinas de desligamento de ambientes não produtivos quando aplicável.
  •  Identificar recursos sem utilização ou sem proprietário definido.
  •  Criar dashboards, alertas e relatórios de custos.
  •  Avaliar o impacto financeiro antes da implantação de novas arquiteturas.
  •  Recomendar ações de redução de custos sem comprometer disponibilidade, segurança ou desempenho.
  •  Apoiar a criação de uma cultura de FinOps na empresa.

Bancos de dados e cache
A posição não substituirá o DBA, mas deverá possuir conhecimento suficiente para administrar e diagnosticar a infraestrutura desses serviços.
Será responsável por:
  •  Monitorar ambientes Amazon RDS.
  •  Analisar CPU, memória, storage, IOPS, conexões e latência.
  •  Apoiar o dimensionamento de instâncias MySQL e PostgreSQL.
  •  Analisar gargalos de infraestrutura que afetem o banco de dados.
  •  Apoiar configurações de backup, snapshots, read replicas e failover.
  •  Participar de testes de restore.
  •  Monitorar e administrar Amazon ElastiCache e Redis.
  •  Investigar consumo de memória, conexões, eviction e indisponibilidade do cache.
  •  Apoiar a análise de queries lentas e excesso de conexões em conjunto com desenvolvimento e DBA.
  •  Planejar manutenções e mudanças com menor impacto para as aplicações.
  •  Participar da definição de RTO e RPO para bancos e caches.

CI/CD e automação
  •  Criar e manter pipelines utilizando AWS CodePipeline e CodeBuild.
  •  Automatizar build, criação de imagens, publicação no ECR e deploy.
  •  Integrar pipelines com ECS, EKS e infraestrutura como código.
  •  Criar processos seguros de promoção entre desenvolvimento, homologação e produção.
  •  Implementar validações antes de alterações de infraestrutura.
  •  Criar scripts em Python ou Bash para automação de atividades operacionais.
  •  Utilizar Python e boto3 para inventário, monitoramento, segurança, custos e rotinas administrativas.
  •  Reduzir tarefas manuais e repetitivas.
  •  Apoiar a implementação de estratégias de rollback.
  •  Garantir rastreabilidade das mudanças executadas.

Continuidade e recuperação de desastre
  •  Definir e revisar políticas de backup.
  •  Garantir que recursos críticos estejam incluídos nas rotinas de backup.
  •  Realizar testes periódicos de restauração.
  •  Documentar procedimentos de recuperação.
  •  Apoiar a definição de RTO e RPO por sistema.
  •  Avaliar a necessidade de redundância entre zonas e regiões.
  •  Planejar a recuperação de aplicações, bancos, arquivos, configurações e segredos.
  •  Criar runbooks de disaster recovery.
  •  Participar de simulações de falha e indisponibilidade.
  •  Identificar pontos únicos de falha e propor correções.

Incidentes e suporte à produção
  •  Atuar diretamente na investigação de incidentes de infraestrutura.
  •  Identificar rapidamente se a origem está em rede, container, cluster, banco, cache, pipeline ou serviço AWS.
  •  Participar de salas de crise quando necessário.
  •  Comunicar impacto, diagnóstico e ações de maneira objetiva.
  •  Executar correções emergenciais com controle de risco.
  •  Registrar as mudanças realizadas durante o incidente.
  •  Conduzir ou participar de análises de causa raiz.
  •  Criar ações preventivas para evitar recorrência.
  •  Apoiar equipes de desenvolvimento durante incidentes relacionados às aplicações.
  •  Criar automações e documentação para problemas recorrentes.

Requisitos obrigatórios
  •  Experiência sólida como Engenheiro de Infraestrutura, Cloud Engineer, Platform Engineer ou função equivalente.
  •  Experiência prática e recente com AWS em ambientes críticos de produção.
  •  Conhecimento avançado de Amazon VPC.
  •  Conhecimento avançado de Security Groups, rotas, subnets e conectividade.
  •  Experiência sólida com IAM, roles, policies e princípio do menor privilégio.
  •  Experiência prática com Amazon ECS e AWS Fargate.
  •  Experiência com AWS CodePipeline e CodeBuild.
  •  Experiência com AWS Secrets Manager.
  •  Experiência avançada com Amazon CloudWatch.
  •  Experiência com configuração de alarms, metrics, logs e dashboards.
  •  Experiência prática com Docker.
  •  Experiência prática com Kubernetes em produção.
  •  Capacidade de implementar e administrar clusters Kubernetes.
  •  Experiência com Amazon EKS ou Kubernetes gerenciado equivalente.
  •  Experiência com Terraform ou CloudFormation.
  •  Experiência com criação e manutenção de pipelines de CI/CD.
  •  Domínio de Linux e troubleshooting.
  •  Conhecimento de redes, DNS, certificados, VPN e controle de acesso por IP.
  •  Conhecimento de Load Balancers e health checks.
  •  Experiência com investigação de incidentes de produção.
  •  Conhecimento de backup, restore, alta disponibilidade e disaster recovery.
  •  Conhecimento de segurança de infraestrutura em nuvem.
  •  Capacidade de analisar e otimizar custos AWS.
  •  Conhecimento operacional de bancos de dados relacionais e Redis.
  •  Experiência com Git e processos de revisão de mudanças.
  •  Capacidade de criar documentação técnica e runbooks.
  •  Disponibilidade para atuação presencial quatro vezes por semana em São Paulo.

Conhecimentos esperados de Kubernetes
Para esta posição, não será suficiente ter apenas realizado cursos ou laboratórios de Kubernetes.
O profissional deverá possuir experiência prática com:
  •  Arquitetura de clusters Kubernetes;
  •  Deployments;
  •  StatefulSets;
  •  DaemonSets;
  •  Services;
  •  Ingress;
  •  ConfigMaps;
  •  Secrets;
  •  Jobs e CronJobs;
  •  Requests e limits;
  •  Readiness e liveness probes;
  •  Horizontal Pod Autoscaler;
  •  Persistent Volumes;
  •  Helm;
  •  Namespaces;
  •  RBAC;
  •  Network Policies;
  •  Troubleshooting de pods;
  •  Diagnóstico de DNS e rede;
  •  Análise de consumo de CPU e memória;
  •  Estratégias de rollout e rollback;
  •  Gestão de logs e métricas;
  •  Atualização e manutenção de clusters.

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available