阿里云智能-模型性能优化专家-PAI
Company Aliyun
Focus Tech · Backend
Location 北京, 杭州
Published June 10, 2026
岗位职责
你将加入PAI平台团队,负责面向各类AI应用场景的模型训练与推理性能优化工作。该岗位聚焦于AI计算性能与系统效率的极致提升,以多层次优化手段,持续提升模型训练与推理的速度、稳定性与资源利用率,具体工作内容包含但不限于:
- 分析客户模型在不同硬件(GPU、NPU、CPU 等)和集群环境中的性能瓶颈,制定优化方案;
- 对主流深度学习框架(如 PyTorch、TensorFlow、JAX 等)进行算子、内核或图优化;
- 深入理解分布式训练架构(如数据并行、模型并行、流水并行等),优化通信与调度性能;
- 在推理端负责模型性能瓶颈分析,并进行量化、剪枝、融合、TensorRT/ONNX Runtime 等优化;
- 与平台团队协作,优化训练任务调度、算力利用、容器化运行效率以及多租户资源隔离;
- 支持重点客户模型性能调优,提供端到端性能优化方案与技术支持。
任职要求
必备条件:
- 深度学习框架:熟悉至少一种主流深度学习框架(PyTorch、TensorFlow、JAX、DeepSpeed、Megatron 等),理解其底层执行机制与扩展方式;
- 工程能力:熟练掌握 C++ 与 Python,具备扎实的工程实现能力和良好的代码素养;
- 硬件加速经验:具备 GPU(CUDA、cuDNN、NCCL)或 AI 加速芯片(GPU,PPU等)的性能优化实战经验;
- 分布式训练:熟悉分布式训练框架与通信原理(如 Ring AllReduce、Horovod、DeepSpeed、Megatron-LM 等),理解并行策略(DP/TP/PP/EP)的设计权衡;
- 性能分析:熟练使用性能 profiling 工具(nsys、nvprof、perf、torch.profiler 等),能够快速定位并解决性能瓶颈;
- AI Coding 能力:熟练使用 Claude Code、Cursor、Copilot 等 AI 编程工具提升开发效率,具备良好的 prompt 设计与人机协作意识,能够将 AI 工具有效融入日常开发、调试与代码审查流程;
- 软素质:具备优秀的客户导向意识,心态开放,善于跨团队协作;学习能力强,自我驱动力足,能够持续跟踪前沿技术并结合客户场景落地。
加分项:
- 具备大模型训练与推理优化经验(GPT、Llama、Diffusion、MoE 等),熟悉显存优化、算子融合、量化压缩等技术;
- 熟悉自动驾驶或具身智能方向的模型与系统(多模态感知、规划控制、强化学习、SLAM、Policy 训练等);
- 了解 AI 编译器技术栈(XLA、TVM、TensorRT、OneDNN、AITemplate、BladeDISC 等),具备算子开发或图优化经验;
- 有在 AI 平台、云平台或框架团队工作的经验;
- 对 AI 系统性能调优、算力调度、集群调度系统(K8s、Ray、Slurm 等)有实践经验;
- 有构建 AI Coding Agent、代码生成类系统、或多 Agent 协同工作流的经验者优先。