【蚂蚁星】AI Infra 训练引擎 / 训练框架研发工程师-27届
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published July 28, 2026
岗位职责
部门介绍: 在万卡规模上,重新定义大模型训练基础设施。我们正在建设面向大模型时代的 AI Infra,支撑超大规模算力集群稳定运行,覆盖预训练、持续预训练、SFT、RL、MoE、多模态等多种训练场景。深入训练系统的核心:从分布式并行、通信优化、算子融合,到容错恢复、精度保障和资源调度,让百亿、千亿、万亿参数模型在大规模异构集群上真正做到——跑得起来、稳定收敛、极致高效。目前平台已支撑上万次大模型训练任务,训练任务规模持续增长。你将参与建设的每一项能力,都将在真实的万卡集群和核心业务模型上接受检验。 为什么加入我们:你面对的不是实验室级的小规模 Demo,而是:万卡级算力规模、真实的大模型训练负载、复杂的生产级硬件环境,以及仍有大量空白等待突破的训练系统。你可以在这里同时获得训练框架的技术深度、万卡集群的系统复杂度,以及与顶尖团队共同探索新模型、新架构的机会。成为下一代大模型训练基础设施的建设者。
职位描述:
- 研发大模型训练引擎与训练框架,支持 CPT、SFT、RL、MoE、长上下文及多模态训练;
- 深入 PyTorch、Megatron、FSDP、verl等训练体系,设计张量并行、流水并行、数据并行、专家并行等分布式方案;
- 面向万卡级集群优化计算、通信、显存和存储效率,解决训练中的性能长尾、通信瓶颈和规模化稳定性问题;
- 建设 Checkpoint、断点续训、故障自愈、弹性训练、精度比对和可观测能力,提高大规模训练成功率;
- 适配多种 AI 芯片及异构算力平台,推动训练框架、通信库、算子与硬件之间的深度协同;
- 深入 Algorithm-System Co-design,让新的模型结构和训练方法能够更快、更高效地落地。
任职要求
1.熟悉 Python、C++ 中至少一种语言,具备良好的系统设计和工程实现能力; 2. 熟悉 PyTorch 训练机制,对分布式训练、并行策略、显存优化或高性能计算有实践经验; 3. 对 Megatron-LM、FSDP、verl 等框架中的一种或多种有深入理解; 4. 熟悉 NCCL/HCCL、RDMA、集合通信、GPU/NPU 算子优化者优先; 5. 有大模型预训练、MoE、长序列、强化学习训练或千卡级集群实践经验者优先; 6. 喜欢解决真正困难的问题,愿意从模型、框架、系统一直深入到芯片和网络。
特色标签
C/C++、Docker、Fully Sharded Data Parallel、Kernel融合、Kubernetes、Linux开发/部署经验、Megatron-LM、Python、PyTorch、PyTorch分布式、PyTorch训练机制、TensorFlow、万亿参数模型、云服务、云计算、分布式经验、分布式计算、分布式训练、分布式训练框架、千卡级集群、基础设施、多模态算法、大模型算法、层内并行、层间并行、巨量参数模型、并行计算、异构集群、强化学习、断点续训、有留学背景、机器学习经验、模型加速/性能优化、模型并行、模型检查点、流水线并行、深度学习、深度学习框架、算子优化、算法工程化经验、系统架构设计经验、英美留学生、训练引擎、训练快照、超大规模模型、超大规模算力集群