Evaluation Reliability SRE
Core
Build and maintain the production infrastructure backbone for Siri's AI evaluation signal, ensuring reliability across orchestration, capacity, and service health for Apple Intelligence.
Role type
Senior hands-on Site Reliability Engineer (SRE)
Builds
Production evaluation infrastructure stack (orchestration, capacity, observability)
Domain
Consumer AI assistants / Distributed systems / ML evaluation infrastructure
Deliverable
infrastructure
Required skills
Kubernetes orchestration, production on-call ownership, incident investigation, runbook authoring, automation, observability instrumentation, SLO definition, distributed systems reliability
Preferred skills
Device/VM provisioning pipeline ownership, virtualization-layer failure diagnosis, incident command leadership, cross-team technical influence
Technologies
Kubernetes, agentic coding tools (Claude Code, Cursor, Copilot)
Responsibilities
Own reliability outcomes for orchestration, capacity, and service health; author high-quality runbooks for complex failure categories; diagnose upstream issues in device orchestration and provisioning layers; instrument infrastructure components lacking observability; balance incident response with proactive reliability automation; define SLOs and burn-rate alerts; mentor junior SREs and influence technical roadmap