Site Reliability Engineer II
Core
Design and build a Kubernetes-based platform for automating infrastructure lifecycle management and provide self-service datastore solutions.
Role type
Senior IC Site Reliability Engineer (Platform & Datastore)
Builds
Kubernetes platform, self-service datastore solutions, infrastructure automation tooling
Domain
Cloud Infrastructure, Distributed Systems, Data Engineering
Deliverable
production ML models | infrastructure
Required skills
Kubernetes, distributed systems design, microservice architectures, agentic AI/LLM tooling, observability (Grafana/Datadog/New Relic), relational/NoSQL datastores (MySQL/Cassandra/PostgreSQL), message queues (Kafka), infrastructure as code (Terraform/Pulumi)
Preferred skills
Master's degree, platform automation experience, developer experience tooling experience
Technologies
Kubernetes, Azure, AWS, GCP, Grafana, Datadog, New Relic, MySQL, Cassandra, PostgreSQL, Kafka, Terraform, Pulumi
Responsibilities
Contribute to infrastructure as code practices and technical code reviews, support platform architecture decisions, design and build Kubernetes-based platform, collaborate on application design patterns, operate self-service datastore platform, diagnose datastore performance bottlenecks
Seniority
Senior, hands-on IC
