Lead, Site Reliability Engineering
Core
Senior Site Reliability Engineer ensuring system stability, performance, and operational resilience by converting operational signals into preventative actions.
Role type
Senior IC Site Reliability Engineer (Generalist)
Builds
Production ML models | product features | infrastructure
Domain
Fintech / Payments / Cloud Infrastructure
Deliverable
production ML models
Required skills
Systems reasoning, Observability strategy, Scripting and automation, Linux/Networking/Containers expertise, Data analysis, Machine learning concepts
Preferred skills
Data storytelling, Cross-team collaboration, Mentorship
Technologies
Logs, Metrics, Traces, Containers, Linux, Databases, Networking
Responsibilities
Analyze application behavior and historical incidents to identify failure patterns; Lead troubleshooting and root cause analysis for high severity incidents; Design and evolve observability strategies across logs, metrics, and traces; Lead automation efforts to reduce manual intervention and operational toil; Mentor engineers in proactive troubleshooting and systems thinking.
Seniority
Senior, hands-on IC

