Staff Software Engineer, Reliability
Core
Own reliability across the entire Metropolis platform, ensuring system availability, resilience, and observability for mission-critical mobility infrastructure.
Role type
Staff Software Engineer (Reliability/SRE)
Builds
Foundational infrastructure for mobility commerce, including failover systems, observability platforms, and resilience patterns.
Domain
Mobility, Parking, Real Estate, Cloud Infrastructure
Required skills
Reliability Engineering, Distributed Systems Architecture, Cloud Operations (AWS), Observability (Datadog), Incident Management, Database Replication, Chaos Engineering, JVM Performance, AI-powered coding tools
Preferred skills
Scala, SRE at hyperscale (Google/Amazon/Netflix), Incident Response Leadership, Performance Optimization, Open Source Contributions
Technologies
AWS, Datadog, Scala, Java, TypeScript, React, MySQL, PostgreSQL, Snowflake, Git, GitHub Copilot
Responsibilities
Design automatic failover mechanisms for external dependencies; Architect regional deployment strategies with database replication; Establish comprehensive monitoring and SLO-based alerting; Own incident management processes and MTTR reduction; Drive adoption of resilience patterns and chaos engineering; Build local mirrors for critical dependencies.
Seniority
Staff, hands-on IC with strategic influence