Site Reliability Engineer II (Full Time) - United States
Core
Maintain services in a FedRAMP compliant environment, ensuring 24/7 availability, resilience, and performance for global cloud platforms and mission-critical machine data.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Global cloud observability platform and multi-tenant cloud services
Domain
Cloud infrastructure & Observability
Deliverable
production ML models | infrastructure
Required skills
Incident response, automated playbooks, root cause analysis, on-call rotation, multi-tenant environment management
Preferred skills
Configuration management (Puppet, Ansible, Terraform), containerization (Docker, Kubernetes), Splunk (SPL, dashboards), OpenTelemetry, AI developer tooling
Technologies
Splunk, OpenTelemetry, Puppet, Ansible, Terraform, Docker, Kubernetes, Claude, GitHub Copilot, Codex
Responsibilities
Monitor and triage infrastructure and application alerts, lead end-to-end incident response and major incident management, implement automated playbooks and SOPs, collaborate on Post-Incident Reviews, participate in operational on-call rotation
Seniority
Senior, hands-on IC