AI Site Reliability Engineer (AI SRE)

Purpose

Ensure reliability, performance, and cost efficiency of AI services in production telco environments.

Key Responsibilities

  • Define and enforce SLIs/SLOs for AI services (latency, availability, accuracy)
  • Monitor model drift, performance degradation, hallucination rates
  • Manage incident response, root cause analysis, DR/HA
  • Optimise cost-performance trade-offs (GPU usage, inference scaling)
Ensure high availability for mission-critical use cases (fraud, network ops)

Requirements

  • SRE practices, observability (OpenTelemetry, Datadog)
  • Experience with high-scale distributed systems
  • Knowledge of AI monitoring (drift, bias, inference metrics)
Strong debugging and incident management skills

Benefits

  • Service uptime
  • Mean time to recovery (MTTR)
Cost vs performance efficiency