Site Reliability Engineer, AiDP Production Engineering
Core
Design, build, and run resilient data infrastructure (pipelines, applications, and analytics platforms) at massive scale to support Apple's core business functions including sales, finance, and operations.
Role type
Senior Site Reliability Engineer (Data Infrastructure)
Builds
Real-time, near real-time, and batch analytical solutions on bare-metal, AWS, and Kubernetes
Domain
Data Engineering & Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Cloud-native services, Apache Spark, Apache Flink, Kafka, AWS, GCP, Kubernetes, distributed databases (Snowflake, Cassandra, SingleStore, SAP HANA), Python, Java
Preferred skills
System design, incident management, observability (Prometheus, Grafana, CloudWatch), performance analysis, GenAI/automation tools, data visualization (Tableau, Business Objects, ThoughtSpot)
Technologies
Kafka, Spark, Iceberg, Airflow, AWS, GCP, Kubernetes, Snowflake, Cassandra, SingleStore, SAP HANA, Prometheus, Grafana, CloudWatch, Tableau, Business Objects, ThoughtSpot
Responsibilities
Configure and tune multi-tiered systems for performance and availability; build automation for self-healing systems; monitor high-performance applications and alert on latency; troubleshoot application, network, and system issues; triage incidents and implement mitigation steps; conduct root cause analysis (RCA); support Java-based applications and Spark/Flink jobs; share on-call rotation for in-scope services
Seniority
Senior, hands-on IC