Senior Site Reliability Engineer
Core
Design and develop automation to reduce manual operational tasks, improve observability, and ensure reliability for business-critical platforms across Azure and on-premises environments.
Role type
Senior Site Reliability Engineer (hands-on IC)
Builds
Automated infrastructure provisioning, disaster recovery playbooks, monitoring plugins, and CI/CD pipelines
Domain
Financial services, Cloud infrastructure, Windows Server administration
Required skills
PowerShell, Python, Bash, Ansible, Terraform, Azure, Grafana, Prometheus, CI/CD, Incident Management, Root Cause Analysis, Disaster Recovery, Windows Server Administration
Preferred skills
Kubernetes, AKS, ServiceNow, Vulnerability Management, SLI/SLO concepts
Technologies
Azure, Terraform, Ansible, PowerShell, Python, Grafana, Prometheus, Jenkins, GitHub Actions, GitLab CI, Windows Server, Active Directory
Responsibilities
Design and develop automation to reduce repetitive manual operational tasks; Implement infrastructure as code using Terraform; Improve monitoring, observability, and alerting using Grafana; Support production infrastructure across Azure and on-premises environments; Participate in Sev1/2/3 production incidents and take technical ownership through service restoration; Troubleshoot complex Windows Server infrastructure issues including Active Directory and Group Policy.
Seniority
Senior, hands-on IC