训练性能优化专家-计算
Core
Lead server-side training optimization for full-stack intelligent driving models (perception/BEV fusion/prediction/planning) to balance model accuracy, training efficiency, and server resource costs.
Role type
Senior IC machine-learning engineer (training optimization)
Builds
Production-ready training pipelines and performance benchmarks for autonomous driving systems
Domain
Autonomous driving / High-performance computing
Deliverable
production ML models
Required skills
C++/Python high-performance programming, PyTorch/TensorFlow kernel internals, distributed training logic (DDP/DeepSpeed ZeRO), neural network optimization, parallel computing, multi-modal data processing, BEV perception/3D detection principles, model quantization, sparsification, gradient compression, cluster architecture design, RDMA optimization, mixed parallelism strategies, massive data transfer optimization, core operator development, TVM compilation optimization, server chip instruction set adaptation
Preferred skills
Profiling tools (PyTorch Profiler/NVIDIA Nsight/domestic tools), full-link bottleneck localization
Responsibilities
Implement mixed-precision training, structured sparsification, and gradient compression techniques; build automated tuning/testing pipelines; optimize cross-node RDMA/TCP communication and low-latency serialization for PB-scale multi-sensor data; adapt GPU/domestic AI chip clusters via data sharding and hybrid parallelism; diagnose and resolve training bottlenecks using profiling tools.