AI Site Reliability Engineer (AI SRE)
Purpose
Ensure reliability, performance, and cost efficiency of AI
services in production telco environments.
Key Responsibilities
- Define
and enforce SLIs/SLOs for AI services (latency, availability,
accuracy)
- Monitor
model drift, performance degradation, hallucination rates
- Manage
incident response, root cause analysis, DR/HA
- Optimise
cost-performance trade-offs (GPU usage, inference scaling)
Requirements
- SRE
practices, observability (OpenTelemetry, Datadog)
- Experience
with high-scale distributed systems
- Knowledge
of AI monitoring (drift, bias, inference metrics)
Benefits
- Service
uptime
- Mean
time to recovery (MTTR)