CareerPlanSign in

Evaluation Reliability SRE

Cupertino, United States of America💼 Full-time🗓 2026-05-29 → 2026-09-28

Core

Build and maintain the production infrastructure backbone for Siri's AI evaluation signal, ensuring reliability across orchestration, capacity, and service health for Apple Intelligence.

Role type

Senior hands-on Site Reliability Engineer (SRE)

Builds

Production evaluation infrastructure stack (orchestration, capacity, observability)

Domain

Consumer AI assistants / Distributed systems / ML evaluation infrastructure

Deliverable

infrastructure

Required skills

Kubernetes orchestration, production on-call ownership, incident investigation, runbook authoring, automation, observability instrumentation, SLO definition, distributed systems reliability

Preferred skills

Device/VM provisioning pipeline ownership, virtualization-layer failure diagnosis, incident command leadership, cross-team technical influence

Technologies

Kubernetes, agentic coding tools (Claude Code, Cursor, Copilot)

Responsibilities

Own reliability outcomes for orchestration, capacity, and service health; author high-quality runbooks for complex failure categories; diagnose upstream issues in device orchestration and provisioning layers; instrument infrastructure components lacking observability; balance incident response with proactive reliability automation; define SLOs and burn-rate alerts; mentor junior SREs and influence technical roadmap

Sourced via apple · Listed on CareerPlan, which tracks 854,000+ jobs from 20+ sources.