jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

Token Foundry-训练系统算法工程师-Qwen

Company 通义实验室

Focus 技术 · 算法

北京, 杭州

July 29, 2026

岗位职责

  1. 训练策略设计与优化: 深入理解预训练与RL后训练(如PPO/GRPO等)算法流程,设计并优化大规模分布式训练策略(3D并行、MoE EP、Context Parallel等),解决RL阶段多模型(Actor/Critic/Rollout/Ref)交互的复杂调度与显存墙问题。
  2. 框架定制与二次开发: 基于主流训练框架(如Megatron-LM, DeepSpeed等),进行应用层和策略层的二次开发与插件编写,快速支持新模型架构(如长文本、多模态、新型MoE)和新优化器(如Muon, SOAP)的落地验证。
  3. 大规模训练稳定性保障(Troubleshooting): 负责千卡/万卡集群训练的稳定性攻坚。排查并解决训练过程中的Loss Spike、OOM、Hang、通信死锁等疑难杂症,开发自动化诊断、监控与容错恢复工具链。
  4. 跨团队协同与联合调优: 作为算法侧接口人,与Infra团队紧密协同。从算法和框架视角提出性能优化需求,配合底层团队完成算子、通信库及硬件层面的联合Profiling与调优,而非独立承担底层基建开发。
  5. 前沿技术追踪与落地: 跟踪SOTA大模型训练技术,评估新技术在Qwen训练场景下的适用性,推动训练框架在算法侧的持续演进。

任职要求

  1. 学历与基础: 计算机科学、人工智能或相关专业本科及以上学历(硕博优先),具备扎实的深度学习理论基础,熟悉Transformer架构及LLM预训练/后训练(RLHF/RL)核心算法。
  2. 框架能力: 深入理解主流大模型训练框架(Megatron-LM, DeepSpeed, FSDP等)的工作机制与架构设计,具备丰富的源码级Debug、二次开发及插件编写能力。
  3. 分布式与调度经验: 熟悉GPU并行计算原理及集合通信原语,具备大规模分布式训练系统设计经验。有RL后训练多模型调度、MoE专家并行(EP)通信优化、或长文本Context Parallel实际落地经验者优先。
  4. 问题排查能力: 具备极强的Troubleshooting能力,熟练使用Nsys、Torch Profiler等工具,能够独立定位并解决大规模集群训练中的性能瓶颈、Loss异常及系统崩溃问题。
  5. 编程与协同: 精通Python。具备极强的跨团队沟通能力和目标导向意识。

加分项:

  1. 具备千卡/万卡规模大模型预训练或RL训练的实际实操与稳定性保障经验。
  2. 在系统顶会(OSDI/SOSP/ASPLOS等)或AI顶会(NeurIPS/ICLR等)发表过相关论文。
  3. 在知名开源大模型训练框架(如Megatron-LM, vLLM等)中有核心代码贡献。

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.