【Plan A】AI工程师(大模型算法与系统协同优化)-百灵-27届
Company Antgroup
Focus Tech · Backend
Location 北京, 上海, 杭州, 成都
Published May 14, 2026
岗位职责
在 Ling Team,我们不将算法与工程割裂看待。 当模型进入万亿参数、百万亿 token、万卡级集群规模时:架构设计就是系统设计,训练范式就是分布式问题。 本岗位聚焦 算法 × 工程 co-design,你将深度参与模型架构、预训练与强化学习训练范式的系统级落地与共创。 我们寻找的不是“支持算法”的工程师,而是能参与定义下一代训练范式的人。
主要职责包括: 模型架构 × 系统共设计 1.参与 MoE / 混合 Attention / Linear Attention 等架构的并行策略设计; 2.设计 EP × TP × CP x PP x DP 等多维并行协同机制; 3.构建高效 KV cache、激活重算与内存调度策略; 4.在架构设计阶段建模通信复杂度与可扩展性; 5.推动 FP8 / FP4 混合精度在全链路落地 。
超大规模预训练系统建设 1.构建百万亿 token 级数据供给与动态采样编排系统; 2.优化 Optimizer × 通信 × 计算协同机制; 3.构建长上下文训练(1M+)的系统级支撑能力; 4.设计万卡级分布式训练架构与通信调度优化方案 。
强化学习与 Agentic 训练优化 1.优化超大规模 RL 训推系统性能; 2.长轨迹 Agentic RL 训练效率优化; 3.大规模 Agent 环境自动化构建和资源管理; 4.持续迭代 Reasoning、Agentic、multi-agent RL 的框架。
任职要求
- 深入理解分布式训练体系(TP / PP / SP / EP / CP 等);
- 熟悉主流大模型训练框架底层实现(Megatron / DeepSpeed / FSDP 等);
- 熟悉 CUDA / NCCL / 通信优化原理;
- 能从算法目标反推系统架构设计;
- 具备从第一性原理推导系统设计的能力;
- 对 scaling law 与系统瓶颈具有直觉判断;
- 敏捷思维与良好协作能力,能与算法研究员进行深度技术对话。
加分项
- 有 100B 以上 MoE 模型预训练系统经验;
- 有强化学习 / RLHF / Agentic 训练系统经验;
- 有 FP8 / FP4 混合精度工程落地经验;
- 有长上下文(100K+)训练与推理优化经验;
- 有超大规模集群稳定性与容错系统设计经验;
- 对算子融合与 kernel 级优化有实践经验;
- 在顶会 / 顶刊发表过系统或架构相关论文;
- 各类高水平竞赛金牌选手。
特色标签
8位浮点精度、CUDA、NCCL、Python、上下文分割并行、上下文并行、专家分区并行、专家并行、专家混合架构、八位浮点数、分布式计算、分布式训练、参加算法相关竞赛/获奖、发表算法相关优秀论文、大模型算法、并行计算、张量分割并行、张量并行、强化学习、强化学习训练、智能体、模型加速/性能优化、注意力机制、流水线并行、混合专家模型、算法工程化经验、线性化注意力、线性注意力、自注意力结构、键值内存缓存、键值缓存、阶段式流水并行