Pessoa engenheira devops / platform reliability sênior
Summary
Senior DevOps/Platform Reliability Engineer responsible for building and evolving CI/CD pipelines, infrastructure, and observability platform for an AI-powered automation platform. Core technologies include GitHub Actions, Terraform, Kubernetes (EKS), Prometheus, Grafana, and various AWS services.
Resumo:
A Ideen está buscando uma pessoa Engenheira DevOps / Platform Reliability Sênior para alocação em um dos nossos clientes, que opera uma plataforma de automação inteligente de processos com uso intensivo de IA (sistemas agênticos) para clientes enterprise. O profissional será responsável pela plataforma que sustenta o produto: construindo e evoluindo a espinha dorsal de CI/CD, infraestrutura e observabilidade que permite entregar sistemas multiagente de forma segura e escalável. É uma posição de alto ownership, que combina operação de uma plataforma de IA em produção com o uso de IA para operá-la.
Responsabilidades:
- Manter e evoluir pipelines de CI/CD (GitHub Actions com autenticação via OIDC) para microsserviços e workloads agênticos, com deploys seguros, rápidos e reversíveis.
- Automatizar o provisionamento de infraestrutura com IaC (Terraform, CloudFormation).
- Operar e escalar a plataforma Kubernetes (EKS + Argo CD): autoscaling, ingress, external-dns, cert-manager, External Secrets Operator, backups, guardrails de runtime e isolamento multi-tenant.
- Gerenciar o edge e o perímetro de rede: Cloudflare (CDN, WAF, Bot Management, DDoS, Zero Trust/Access), CloudFront, API Gateway, ALB/NLB, Route 53 e controles de segurança de rede.
- Operar a camada de dados e eventos: Aurora MySQL, ElastiCache/Redis, S3 e MSK (Kafka), com responsabilidade por backups, PITR e disaster recovery multi-AZ alinhado a RTO/RPO.
- Construir e manter workloads em Lambda quando arquiteturas serverless/event-driven forem adequadas.
- Tratar observabilidade como produto (Prometheus, Grafana, OpenTelemetry), incluindo telemetria de sistemas LLM/agênticos (custo de tokens, latência de tool-calls, sinais de avaliação, versionamento de prompts).
- Fortalecer a postura de segurança e compliance (SOC 2 e HIPAA): IAM de menor privilégio, SCPs, gestão de secrets, SAST/DAST, scanning de dependências e containers, assinatura de imagens, AWS Config, Security Hub, GuardDuty e Inspector.
- Conduzir iniciativas de FinOps: padrões de tagging, Savings Plans e Reserved Instances, atribuição de custo por tenant e por workload, e controles de custo de LLM.
- Desenvolver e evoluir capacidades de DevOps nativas em IA (ver seção abaixo).
- Definir, com os times de engenharia, padrões de plataforma, templates de serviço, boas práticas de deploy e SLOs operacionais.
- Monitorar performance e garantir confiabilidade, escalabilidade e segurança da infraestrutura e dos serviços; documentar processos e padrões operacionais.
IA Agêntica em DevOps:
- Projetar e operar agentes de auto-remediação para toil de produção (rotação de certificados, pods ruidosos, drift de infraestrutura, pipelines de CI instáveis), com controles human-in-the-loop para ações destrutivas ou que impactem clientes.
- Usar LLMs para triagem de incidentes e análise de causa-raiz (sumarização de logs e traces, correlação de sinais, primeiras versões de post-mortems), sempre com revisão humana.
- Conectar agentes de IA a sistemas internos via Model Context Protocol (MCP) GitHub, Jira, PagerDuty, AWS, Kubernetes, Terraform com credenciais escopadas, audit logging e acesso allow-listed.
- Aplicar observabilidade orientada por IA: detecção de anomalias em métricas, clustering de logs por LLM, deduplicação e sumarização de alertas sobre Prometheus e OpenTelemetry.
- Estabelecer guardrails operacionais: pinning de prompt/versão, frameworks de avaliação de comportamento de agentes, controles de custo e rate-limit, policy-as-code (OPA/Conftest) para mudanças de infra geradas por IA e controles claros de blast-radius.
- Definir boas práticas para assistentes de código de IA (ex.: GitHub Copilot, Claude, Amazon Q) em repositórios de infraestrutura, incluindo fluxos de revisão e restrições a merges automáticos.
- Tratar componentes de IA como sistemas de produção, com SLOs, observabilidade, prontidão de on-call, runbooks e estratégias de rollback para agentes e prompts.
Requisitos:
- 5+ anos de experiência em DevOps, SRE ou Platform Engineering operando sistemas em produção na AWS.
- Sólida experiência com pipelines e ferramentas de CI/CD (GitHub Actions, GitLab CI, Jenkins ou CircleCI).
- Experiência prática operando ambientes EKS em produção (autoscaling, ingress, gestão de secrets, upgrades de cluster).
- Sólida experiência em networking AWS (design de VPC multi-conta, subnets, roteamento, security groups, NACLs, Route 53, ACM, load balancers).
- Experiência profunda com Terraform e GitHub Actions, idealmente com autenticação via OIDC.
- Experiência com Aurora/RDS MySQL, Redis (ElastiCache) e S3 (backups, PITR, migrações, lifecycle).
- Sólida experiência em observabilidade com Prometheus, Grafana e OpenTelemetry.
- Experiência operando Argo CD em escala.
- Experiência com IaC (Terraform, CloudFormation ou Ansible).
- Experiência gerenciando serviços Cloudflare (WAF, Bot Management, Rate Limiting, Zero Trust/Access) e CloudFront.
- Experiência operando Kafka/MSK em escala (tópicos, consumer groups, schema registries).
- Experiência com Lambda e arquiteturas event-driven.
- Domínio de Python, Bash e sistemas Linux.
- Sólido entendimento de boas práticas de segurança (IAM, KMS, secrets, networking, software supply chain).
- Familiaridade com ferramentas de vulnerability scanning e compliance.
- Inglês fluente (obrigatório), para atuação e reporte com equipes internacionais.
Diferencial:
- Experiência operando workloads de LLM ou ML em produção (LiteLLM, Bedrock, pgvector, prompt caching ou sistemas de avaliação).
- Experiência construindo ou integrando servidores MCP, ou implantando frameworks de agentes (ex.: LangGraph, CrewAI) em produção.
Informações da Empresa:
Na Ideen unimos tecnologia e estratégia para transformar desafios complexos em soluções que geram impacto real para grandes empresas. Somos um time movido por inovação, estratégia e resultados. Se busca um ambiente com autonomia, desafios relevantes e oportunidades reais de crescimento, a Ideen pode ser o próximo passo da sua jornada.