freehire launches on Product Hunt on 26 August.

Follow →

Pessoa engenheira devops / platform reliability sênior

Summary

Senior DevOps/Platform Reliability Engineer responsible for building and evolving CI/CD pipelines, infrastructure, and observability platform for an AI-powered automation platform. Core technologies include GitHub Actions, Terraform, Kubernetes (EKS), Prometheus, Grafana, and various AWS services.

Resumo:
A Ideen está buscando uma pessoa Engenheira DevOps / Platform Reliability Sênior para alocação em um dos nossos clientes, que opera uma plataforma de automação inteligente de processos com uso intensivo de IA (sistemas agênticos) para clientes enterprise. O profissional será responsável pela plataforma que sustenta o produto: construindo e evoluindo a espinha dorsal de CI/CD, infraestrutura e observabilidade que permite entregar sistemas multiagente de forma segura e escalável. É uma posição de alto ownership, que combina operação de uma plataforma de IA em produção com o uso de IA para operá-la.

Responsabilidades:

  • Manter e evoluir pipelines de CI/CD (GitHub Actions com autenticação via OIDC) para microsserviços e workloads agênticos, com deploys seguros, rápidos e reversíveis.
  • Automatizar o provisionamento de infraestrutura com IaC (Terraform, CloudFormation).
  • Operar e escalar a plataforma Kubernetes (EKS + Argo CD): autoscaling, ingress, external-dns, cert-manager, External Secrets Operator, backups, guardrails de runtime e isolamento multi-tenant.
  • Gerenciar o edge e o perímetro de rede: Cloudflare (CDN, WAF, Bot Management, DDoS, Zero Trust/Access), CloudFront, API Gateway, ALB/NLB, Route 53 e controles de segurança de rede.
  • Operar a camada de dados e eventos: Aurora MySQL, ElastiCache/Redis, S3 e MSK (Kafka), com responsabilidade por backups, PITR e disaster recovery multi-AZ alinhado a RTO/RPO.
  • Construir e manter workloads em Lambda quando arquiteturas serverless/event-driven forem adequadas.
  • Tratar observabilidade como produto (Prometheus, Grafana, OpenTelemetry), incluindo telemetria de sistemas LLM/agênticos (custo de tokens, latência de tool-calls, sinais de avaliação, versionamento de prompts).
  • Fortalecer a postura de segurança e compliance (SOC 2 e HIPAA): IAM de menor privilégio, SCPs, gestão de secrets, SAST/DAST, scanning de dependências e containers, assinatura de imagens, AWS Config, Security Hub, GuardDuty e Inspector.
  • Conduzir iniciativas de FinOps: padrões de tagging, Savings Plans e Reserved Instances, atribuição de custo por tenant e por workload, e controles de custo de LLM.
  • Desenvolver e evoluir capacidades de DevOps nativas em IA (ver seção abaixo).
  • Definir, com os times de engenharia, padrões de plataforma, templates de serviço, boas práticas de deploy e SLOs operacionais.
  • Monitorar performance e garantir confiabilidade, escalabilidade e segurança da infraestrutura e dos serviços; documentar processos e padrões operacionais.

IA Agêntica em DevOps:

  • Projetar e operar agentes de auto-remediação para toil de produção (rotação de certificados, pods ruidosos, drift de infraestrutura, pipelines de CI instáveis), com controles human-in-the-loop para ações destrutivas ou que impactem clientes.
  • Usar LLMs para triagem de incidentes e análise de causa-raiz (sumarização de logs e traces, correlação de sinais, primeiras versões de post-mortems), sempre com revisão humana.
  • Conectar agentes de IA a sistemas internos via Model Context Protocol (MCP) GitHub, Jira, PagerDuty, AWS, Kubernetes, Terraform com credenciais escopadas, audit logging e acesso allow-listed.
  • Aplicar observabilidade orientada por IA: detecção de anomalias em métricas, clustering de logs por LLM, deduplicação e sumarização de alertas sobre Prometheus e OpenTelemetry.
  • Estabelecer guardrails operacionais: pinning de prompt/versão, frameworks de avaliação de comportamento de agentes, controles de custo e rate-limit, policy-as-code (OPA/Conftest) para mudanças de infra geradas por IA e controles claros de blast-radius.
  • Definir boas práticas para assistentes de código de IA (ex.: GitHub Copilot, Claude, Amazon Q) em repositórios de infraestrutura, incluindo fluxos de revisão e restrições a merges automáticos.
  • Tratar componentes de IA como sistemas de produção, com SLOs, observabilidade, prontidão de on-call, runbooks e estratégias de rollback para agentes e prompts.

Requisitos:

  • 5+ anos de experiência em DevOps, SRE ou Platform Engineering operando sistemas em produção na AWS.
  • Sólida experiência com pipelines e ferramentas de CI/CD (GitHub Actions, GitLab CI, Jenkins ou CircleCI).
  • Experiência prática operando ambientes EKS em produção (autoscaling, ingress, gestão de secrets, upgrades de cluster).
  • Sólida experiência em networking AWS (design de VPC multi-conta, subnets, roteamento, security groups, NACLs, Route 53, ACM, load balancers).
  • Experiência profunda com Terraform e GitHub Actions, idealmente com autenticação via OIDC.
  • Experiência com Aurora/RDS MySQL, Redis (ElastiCache) e S3 (backups, PITR, migrações, lifecycle).
  • Sólida experiência em observabilidade com Prometheus, Grafana e OpenTelemetry.
  • Experiência operando Argo CD em escala.
  • Experiência com IaC (Terraform, CloudFormation ou Ansible).
  • Experiência gerenciando serviços Cloudflare (WAF, Bot Management, Rate Limiting, Zero Trust/Access) e CloudFront.
  • Experiência operando Kafka/MSK em escala (tópicos, consumer groups, schema registries).
  • Experiência com Lambda e arquiteturas event-driven.
  • Domínio de Python, Bash e sistemas Linux.
  • Sólido entendimento de boas práticas de segurança (IAM, KMS, secrets, networking, software supply chain).
  • Familiaridade com ferramentas de vulnerability scanning e compliance.
  • Inglês fluente (obrigatório), para atuação e reporte com equipes internacionais.

Diferencial:

  • Experiência operando workloads de LLM ou ML em produção (LiteLLM, Bedrock, pgvector, prompt caching ou sistemas de avaliação).
  • Experiência construindo ou integrando servidores MCP, ou implantando frameworks de agentes (ex.: LangGraph, CrewAI) em produção.

Informações da Empresa:
Na Ideen unimos tecnologia e estratégia para transformar desafios complexos em soluções que geram impacto real para grandes empresas. Somos um time movido por inovação, estratégia e resultados. Se busca um ambiente com autonomia, desafios relevantes e oportunidades reais de crescimento, a Ideen pode ser o próximo passo da sua jornada.

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available