【蚂蚁星】大模型训练与推理加速工程师-百灵-27届
Campus
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published August 6, 2026
岗位职责
作为 Ling Team 的 Infra 团队,我们核心聚焦百灵模型的训练与推理加速,致力于提升模型研发效率,支撑百灵模型快速迭代。
职位描述
- 负责百灵模型训练与推理加速,涵盖并行架构、低精度计算、算子与显存优化、跨机通信、数据预处理等关键模块的性能优化;
- 面向万卡规模训练与推理场景,研究效率 scaling 理论,持续挖掘硬件与系统的理论性能上限;
- 与算法团队深度协同开展 co-design,共同设计和优化领先的模型架构。
任职要求
- 深入理解分布式训练体系(TP / PP / SP / EP / CP 等);
- 熟练使用Pytorch深度学习框架,对自动微分有理解;
- 熟悉主流大模型训练框架底层实现(Megatron / DeepSpeed / FSDP 等);
- 熟悉 CUDA / Cutlass / 通信优化原理;
- 具备从第一性原理推导系统设计的能力;
- 对分布式系统性能分析有深入的了解;
- 对 scaling law 与系统瓶颈具备分析能力;
- 数学建模能力,能对工程问题进行理论建模。
加分项:
- 有 100B 以上 MoE 模型预训练系统经验;
- 有 FP8 / FP4 混合精度工程落地经验;
- 有长上下文(100K+)训练与推理优化经验;
- 有超大规模集群稳定性与容错系统设计经验;
- 对算子融合与 kernel 级优化有实践经验;
- 有深度学习框架开发经验;
- 在顶会 / 顶刊发表过系统或架构相关论文;
- 各类高水平竞赛金牌选手。
特色标签
100K以上序列长度优化、C/C++、CUDA编程、Cutlass模板库、FP8/FP4低精度计算、GPU算子优化、Python、万卡级训练、上下文并行、专家并行、主流大模型训练框架、云服务、云计算、低比特量化、内存占用优化、分布式计算、分布式训练、分布式训练优化、分布式训练框架、千亿级模型、千卡级推理、参加算法相关竞赛/获奖、发表算法相关优秀论文、在线推理加速、基础设施、大数据、大模型算法、大语言模型、巨型语言模型、并行计算、张量并行、推理性能优化、推理效率提升、数据并行、显存压缩、显存管理、模型加速/性能优化、模型并行、流水线并行、深度学习、算法工程化经验、精度压缩、训练性能优化、训练效率提升、训练系统框架、超大规模GPU集群、超长上下文训练、长序列推理