【蚂蚁星】大模型训练与推理加速工程师-百灵基模-27届
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published August 6, 2026
岗位职责
作为 Ling Team 的 Infra 团队,我们核心聚焦百灵模型的训练与推理加速,致力于提升模型研发效率,支撑百灵模型快速迭代。
职位描述:
- 负责百灵模型训练与推理加速,涵盖并行架构、低精度计算、算子与显存优化、跨机通信、数据预处理等关键模块的性能优化;
- 面向万卡规模训练与推理场景,研究效率 scaling 理论,持续挖掘硬件与系统的理论性能上限;
- 与算法团队深度协同开展 co-design,共同设计和优化领先的模型架构。
任职要求
- 深入理解分布式训练体系(TP / PP / SP / EP / CP 等);
- 熟练使用Pytorch深度学习框架,对自动微分有理解;
- 熟悉主流大模型训练框架底层实现(Megatron / DeepSpeed / FSDP 等);
- 熟悉 CUDA / Cutlass / 通信优化原理;
- 具备从第一性原理推导系统设计的能力;
- 对分布式系统性能分析有深入的了解;
- 对 scaling law 与系统瓶颈具备分析能力;
- 数学建模能力,能对工程问题进行理论建模。
加分项:
- 有 100B 以上 MoE 模型预训练系统经验;
- 有 FP8 / FP4 混合精度工程落地经验;
- 有长上下文(100K+)训练与推理优化经验;
- 有超大规模集群稳定性与容错系统设计经验;
- 对算子融合与 kernel 级优化有实践经验;
- 有深度学习框架开发经验;
- 在顶会 / 顶刊发表过系统或架构相关论文;
- 各类高水平竞赛金牌选手。
特色标签
C/C++、CUDA kernel、Cutlass、FP4量化、FP8计算、GPU编程、Megatron-LM、Python、Sparse模型、ZeRO优化器、万卡训练提速、上下文并行、专家并行、专家路由、云计算、低延迟推理、分布式训练、分布式训练优化、参加算法相关竞赛/获奖、发表算法相关优秀论文、在线推理提速、基础设施、大模型分布式训练库、大模型算法、大模型训练框架、大语言模型、并行计算、序列并行、张量并行、微软DeepSpeed、性能随规模变化规律、扩展定律、推理性能优化、模型加速/性能优化、流水线并行、深度学习、混合专家模型、混合精度训练、百亿参数模型、系统瓶颈分析、超大规模模型、金融、高效预训练