【蚂蚁星】AI工程师(大模型算法与系统协同优化)-百灵-27届
Campus
Company Antgroup
Focus Tech · Backend
Location 北京, 上海, 杭州, 成都
Published May 14, 2026
岗位职责
在 Ling Team,我们不将算法与工程割裂看待。当模型进入万亿参数、百万亿 token、万卡级集群规模时:
- 架构设计就是系统设计,
- 训练范式就是分布式问题。 本岗位聚焦 算法 × 工程 co-design,你将深度参与模型架构、预训练与强化学习训练范式的系统级落地与共创。我们寻找的不是“支持算法”的工程师,而是能参与定义下一代训练范式的人。
主要职责包括:
- 模型架构 × 系统共设计
- 参与 MoE / 混合 Attention / Linear Attention 等架构的并行策略设计;
- 设计 EP × TP × CP x PP x DP 等多维并行协同机制;
- 构建高效 KV cache、激活重算与内存调度策略;
- 在架构设计阶段建模通信复杂度与可扩展性;
- 推动 FP8 / FP4 混合精度在全链路落地。
- 超大规模预训练系统建设
- 构建百万亿 token 级数据供给与动态采样编排系统;
- 优化 Optimizer × 通信 × 计算协同机制;
- 构建长上下文训练(1M+)的系统级支撑能力;
- 设计万卡级分布式训练架构与通信调度优化方案。
- 强化学习与 Agentic 训练优化
- 优化超大规模 RL 训推系统性能;
- 长轨迹 Agentic RL 训练效率优化;
- 大规模 Agent 环境自动化构建和资源管理;
- 持续迭代 Reasoning、Agentic、multi-agent RL 的框架。
任职要求
- 深入理解分布式训练体系(TP / PP / SP / EP / CP 等);
- 熟悉主流大模型训练框架底层实现(Megatron / DeepSpeed / FSDP 等);
- 熟悉 CUDA / NCCL / 通信优化原理;
- 能从算法目标反推系统架构设计;
- 具备从第一性原理推导系统设计的能力;
- 对 scaling law 与系统瓶颈具有直觉判断;
- 敏捷思维与良好协作能力,能与算法研究员进行深度技术对话。
加分项:
- 有 100B 以上 MoE 模型预训练系统经验;
- 有强化学习 / RLHF / Agentic 训练系统经验;
- 有 FP8 / FP4 混合精度工程落地经验;
- 有长上下文(100K+)训练与推理优化经验;
- 有超大规模集群稳定性与容错系统设计经验;
- 对算子融合与 kernel 级优化有实践经验;
- 在顶会 / 顶刊发表过系统或架构相关论文;
- 各类高水平竞赛金牌选手。
特色标签
1M上下文、Agentic训练、Attention缓存、C/C++、CUDA算子、FP4精度、FP8精度、Kernel融合、NCCL优化、Python、RLHF、RL训练、Sparse MoE、万亿参数模型、万卡级训练、专家混合网络、云服务、云计算、低精度计算、分布式计算、分布式训练、千亿级模型、参加算法相关竞赛/获奖、发表算法相关优秀论文、大模型算法、并行计算、并行训练框架、强化学习、数据采样系统、模型加速/性能优化、混合专家模型、百万亿token系统、算法工程化经验、缓存优化、网络拓扑优化、计算图优化、训练数据管道、超大模型、超长文本训练、键值缓存、长序列训练、集合通信、集群训练