Token Foundry-训练系统算法工程师-Qwen
Company 通义实验室
Focus 技术 · 算法
北京, 杭州
July 29, 2026
岗位职责
- 训练策略设计与优化: 深入理解预训练与RL后训练(如PPO/GRPO等)算法流程,设计并优化大规模分布式训练策略(3D并行、MoE EP、Context Parallel等),解决RL阶段多模型(Actor/Critic/Rollout/Ref)交互的复杂调度与显存墙问题。
- 框架定制与二次开发: 基于主流训练框架(如Megatron-LM, DeepSpeed等),进行应用层和策略层的二次开发与插件编写,快速支持新模型架构(如长文本、多模态、新型MoE)和新优化器(如Muon, SOAP)的落地验证。
- 大规模训练稳定性保障(Troubleshooting): 负责千卡/万卡集群训练的稳定性攻坚。排查并解决训练过程中的Loss Spike、OOM、Hang、通信死锁等疑难杂症,开发自动化诊断、监控与容错恢复工具链。
- 跨团队协同与联合调优: 作为算法侧接口人,与Infra团队紧密协同。从算法和框架视角提出性能优化需求,配合底层团队完成算子、通信库及硬件层面的联合Profiling与调优,而非独立承担底层基建开发。
- 前沿技术追踪与落地: 跟踪SOTA大模型训练技术,评估新技术在Qwen训练场景下的适用性,推动训练框架在算法侧的持续演进。
任职要求
- 学历与基础: 计算机科学、人工智能或相关专业本科及以上学历(硕博优先),具备扎实的深度学习理论基础,熟悉Transformer架构及LLM预训练/后训练(RLHF/RL)核心算法。
- 框架能力: 深入理解主流大模型训练框架(Megatron-LM, DeepSpeed, FSDP等)的工作机制与架构设计,具备丰富的源码级Debug、二次开发及插件编写能力。
- 分布式与调度经验: 熟悉GPU并行计算原理及集合通信原语,具备大规模分布式训练系统设计经验。有RL后训练多模型调度、MoE专家并行(EP)通信优化、或长文本Context Parallel实际落地经验者优先。
- 问题排查能力: 具备极强的Troubleshooting能力,熟练使用Nsys、Torch Profiler等工具,能够独立定位并解决大规模集群训练中的性能瓶颈、Loss异常及系统崩溃问题。
- 编程与协同: 精通Python。具备极强的跨团队沟通能力和目标导向意识。
加分项:
- 具备千卡/万卡规模大模型预训练或RL训练的实际实操与稳定性保障经验。
- 在系统顶会(OSDI/SOSP/ASPLOS等)或AI顶会(NeurIPS/ICLR等)发表过相关论文。
- 在知名开源大模型训练框架(如Megatron-LM, vLLM等)中有核心代码贡献。
岗位标签
NEW