GPU云服务器稳定性架构师-计算
Core
Design and optimize stability architecture for GPU cloud servers in public cloud scenarios, ensuring full-link stability from hardware adaptation to software stacks.
Role type
Senior IC GPU cloud infrastructure stability architect
Builds
GPU cloud server stability monitoring and early warning systems
Domain
Public cloud infrastructure + GPU computing
Deliverable
production ML models
Required skills
GPU hardware principles, CUDA, memory management, compute scheduling, driver mechanisms, C/C++, Go, Python, systematic problem analysis
Preferred skills
Public cloud GPU product stability architecture, GPU fault troubleshooting tools, custom monitoring/diagnostic tool development, AI training/inference stability
Technologies
CUDA, NVIDIA-smi, NVIDIA-debugdump, Nsight
Responsibilities
Design and optimize stability architecture for GPU cloud servers, analyze stability bottlenecks (hardware faults, driver issues, virtualization performance), implement monitoring and early warning systems, introduce industry best practices
Seniority
Senior, hands-on IC