CareerPlanSign in

GPU云服务器稳定性架构师-计算

杭州💼 Full-time🗓 2026-09-28

Core

Design and optimize stability architecture for GPU cloud servers in public cloud scenarios, ensuring full-link stability from hardware adaptation to software stacks.

Role type

Senior IC GPU cloud infrastructure stability architect

Builds

GPU cloud server stability monitoring and early warning systems

Domain

Public cloud infrastructure + GPU computing

Deliverable

production ML models

Required skills

GPU hardware principles, CUDA, memory management, compute scheduling, driver mechanisms, C/C++, Go, Python, systematic problem analysis

Preferred skills

Public cloud GPU product stability architecture, GPU fault troubleshooting tools, custom monitoring/diagnostic tool development, AI training/inference stability

Technologies

CUDA, NVIDIA-smi, NVIDIA-debugdump, Nsight

Responsibilities

Design and optimize stability architecture for GPU cloud servers, analyze stability bottlenecks (hardware faults, driver issues, virtualization performance), implement monitoring and early warning systems, introduce industry best practices

Seniority

Senior, hands-on IC

Sourced via bytedance · Listed on CareerPlan, which tracks 873,000+ jobs from 20+ sources.