Site Reliability Engineer
Core
Ensuring reliability, monitoring, and operational health of production data center services for Apple hardware lifecycle and security initiatives.
Role type
Site Reliability Engineer (SRE)
Builds
Production data center services supporting Apple hardware and eSIM operations
Domain
Hardware security, data center operations, cloud/on-prem hybrid infrastructure
Required skills
Incident triage and root cause analysis, Infrastructure automation, Monitoring and observability design, Kubernetes management, Hybrid infrastructure management (on-prem/cloud), Security practices implementation, Distributed systems troubleshooting, Scripting/programming languages
Preferred skills
SRE principles (error budgets, SLAs/SLOs), Container orchestration, CI/CD pipelines, Release engineering, Distributed systems scalability concepts
Technologies
Kubernetes, Oracle, Cassandra, MongoDB, Postgres, AliCloud, Linux/Unix
Responsibilities
Triage and resolve production incidents, Build automation to reduce manual toil, Design monitoring and alerting coverage, Partner with dev/QA teams on production defects, Participate in capacity planning and architecture discussions, Maintain 24x7 on-call rotation
Seniority
Mid-level, hands-on IC