Software Architect - Reliability Engineering
Core
Drive technical strategy and vision for Twilio's Reliability Engineering organization to ensure global product reliability, scalability, and operational excellence.
Role type
Principal Software Architect (Reliability Engineering / SRE)
Builds
Scalable, fault-tolerant cloud architectures, incident response systems, and reliability tooling for high-traffic SaaS services.
Domain
Cloud Infrastructure, Distributed Systems, Reliability Engineering
Required skills
Strategic technical leadership, large-scale systems design, Kubernetes (EKS), Infrastructure as Code (Terraform/CloudFormation), Observability (Prometheus/Grafana/Datadog), Distributed systems principles, Incident management, SLO/SLI definition, Cross-functional influence
Preferred skills
Large AWS footprint ownership, Data streaming technologies (Apache Kafka/MSK), Mentoring technical leaders
Technologies
Kubernetes, AWS, Terraform, CloudFormation, Prometheus, Grafana, Datadog, Go, Python, Java, Apache Kafka
Responsibilities
Define and lead reliability strategy translating business goals into measurable outcomes; Influence company-wide architectural decisions for availability, performance, and cost efficiency; Design and implement scalable solutions and paved roads for reliable services; Establish reliability practices and drive systemic improvements; Mentor engineers and technical leaders; Track and apply emerging SRE and cloud best practices.
Seniority
Principal, strategy & mentorship