蚂蚁集团-大模型预训练引擎研发专家-百灵团队
Company Antgroup
Focus Tech · Algorithm
Location 上海, 杭州
Published October 9, 2026
岗位职责
百灵大模型预训练 Infra 团队负责百灵模型训练系统的建设与演进,聚焦大规模预训练场景下的效率、扩展性与稳定性问题。团队长期围绕训练加速、并行架构、系统瓶颈分析,与算法开展协同优化,支撑百灵模型在超大规模集群上的持续迭代。
我们的工作方向包括但不限于:
- 大模型训练加速:并行策略、低精度计算、算子与显存优化、跨机通信、数据预处理;
- 超大规模训练效率优化:面向万卡级场景研究 scaling 理论与系统性能上限;
- 算法 / 系统 co-design:与算法团队协同设计和优化模型架构与训练策略;
- 深度学习基础设施建设:参与蚂蚁容错系统 DLRover 的研发与演进。
任职要求
- 具有大模型并行策略/大规模分布式系统设计与研发优化经验;
- 熟悉 CUDA、Cutlass 或主流通信优化原理,具备实际性能分析与调优经验;
- 熟悉主流深度学习框架及分布式训练生态,包括但不限于 PyTorch、Megatron、DeepSpeed、Hugging Face;
- 具备较强的系统分析与抽象能力,能够从第一性原理出发理解和设计系统;
- 对 scaling law、系统瓶颈分析与训练效率建模有较深入理解;
- 具备良好的数学建模能力,能够将复杂工程问题抽象并转化为可验证、可优化的方案;
- 有文本、语音、图像、推荐等一个或多个方向模型经验者优先。
岗位标签
NEW
特色标签
C/C++、CUDA算子、GPU加速、GPU编程、Linux开发/部署经验、Python、PyTorch、TensorFlow、ZeRO优化、万卡集群、中大型项目开发经验、云计算经验、信贷、分布式并行、分布式经验、分布式训练框架、千卡扩展、大模型预训练、大规模预训练、大语言模型、弹性训练系统、微服务经验、微软DeepSpeed、性能扩展规律、性能瓶颈、扩展定律、支付、数据并行、有留学背景、服务端开发经验、机器学习经验、模型并行、系统架构设计经验、系统热点、英语读写能力良好、蚂蚁容错系统、规模效应、计算机相关专业、训练容错平台、训练性能优化、训练提速、训练瓶颈分析、超大模型、超大规模集群、金融、银行、预训练模型、预训练系统、风控、高效训练