训练系统专家Company MeituanFocus Tech · BackendLocation 北京Published August 11, 2026岗位职责 负责自动驾驶模型训练效率与算法迭代效率方向的技术规划和团队管理,持续优化从实验提交、训练执行到评测结果产出的端到端周期; 负责大规模分布式训练性能优化,围绕计算、显存、通信、数据加载、存储等环节定位瓶颈,持续提升训练吞吐、GPU 利用率、扩展效率和训练产出; 建设和优化统一训练能力,包括但不限于分布式训练框架、训练 Profiling、故障诊断、Checkpoint/容错恢复、实验管理及性能回归分析等工具和平台能力; 深入感知、端到端、世界模型等算法研发流程,与算法、数据、存储和算力平台团队协作,推动重点模型训练效率专项并沉淀为通用能力; 建立训练效率和研发迭代效率指标体系,以训练耗时、任务成功率、资源利用率、实验迭代周期等指标衡量并持续改善平台效果; 任职要求 计算机、人工智能、软件工程等相关专业本科及以上学历,具有机器学习系统、分布式训练或相关工程经验,有 Tech Lead 或小团队管理经验; 深入理解 PyTorch 等主流深度学习框架及分布式训练机制,熟悉 DDP、FSDP、DeepSpeed、Megatron-LM 等技术中的一种或多种; 熟悉 Linux、Python,并具备良好的系统开发能力;理解 CUDA、NCCL、RDMA、InfiniBand/RoCE、GPU 架构等相关技术; 具备较强的训练性能分析与系统优化能力、技术判断和跨团队推动能力,能够将单点性能问题抽象并沉淀为可复用的平台能力,对最终算法研发效率负责;