大模型训练框架研发工程师 (训练效率优化方向)(J103616)
Company Baidu
Focus Tech · Algorithm
Location 北京
Published July 28, 2026
岗位职责
-负责公司基础大模型与专精大模型的训练效率优化,面向预训练、SFT、RL、DPO、知识蒸馏等训练场景,专注于提升百亿/千亿/万亿参数规模模型的训练吞吐、资源利用率与稳定性,支撑模型能力高效迭代与落地 -负责构建并持续优化高效的分布式训练框架,探索和优化多维并行策略,包括DP/TP/PP/CP/EP等。紧密跟踪Megatron-LM、DeepSpeed、FSDP等业界主流框架进展,解决大规模训练尤其是长上下文中的显存瓶颈、通信开销和负载均衡问题 -主导高性能训练算子的设计、实现与优化,基于CUDA/CUTLASS/Triton/TileLang等工具,针对MoE、Attention、ViT等特定模型结构进行定制化算子开发。通过算子融合、显存复用、混合精度训练(BF16/FP84)、低比特量化与量化感知训练等手段提升训练吞吐 -构建并维护训练全链路性能分析与稳定性保障体系,熟练使用Nsight Systems/Compute、PyTorch Profiler等工具进行端到端性能瓶颈分析。负责解决大规模训练中的NCCL超时、显存溢出(OOM)、训练波动等稳定性问题,确保训练任务的高效、稳定运行 -探索并引入业界前沿的训练加速技术,例如DualPipe、异步/重叠通信、通信压缩等,持续迭代内部训练平台能力,为算法团队提供更强大的实验支撑
任职要求
-精通C/C++/Python中至少一种语言,具备扎实的编程功底,有丰富的大规模分布式系统开发与调试经验 -深入理解大模型基本原理和Transformer架构,熟悉PyTorch底层机制(如Autograd, Dispatcher, CUDA Stream/Event)。精通Megatron-LM、DeepSpeed、FSDP等至少一种主流分布式训练框架,并具备实际训练调优经验 -具备GPU性能分析与调优能力,熟悉 GPU 体系结构与 CUDA 编程模型,了解SM、Warp、Memory Hierarchy、Tensor Core 等基本原理。具备 CUDA/CUTLASS/Triton等 GPU Kernel 开发与优化经验,能够针对训练热点算子进行性能分析、实现与优化 -深入理解分布式训练中的通信与计算协同,熟悉NCCL通信原语,能分析和优化通信瓶颈,具备百卡/千卡级训练通信调优或稳定性治理经验 -具备优秀的问题定位和工程闭环能力,能够快速定位并攻克训练效率、稳定性等方面的技术难题。具备强烈的自驱力和持续学习精神,热爱挑战,对前沿AI技术始终保持热情 -加分项 -有从零到一搭建或主导优化大规模分布式训练系统的经验 -在顶级会议(如MLSys, NeurIPS, OSDI等)发表过相关论文,或有知名开源项目(如Megatron-LM, DeepSpeed)贡献经验 -了解推理引擎(如sglang, vLLM)的基本原理,能在训练阶段前瞻性地考虑部署优化
部门/组织
大模型框架平台组