【蚂蚁星】AI工程师(大模型算法与系统协同优化)-百灵-27届

Campus

Company Antgroup

Focus Tech · Backend

Location 北京, 上海, 杭州, 成都

Published May 14, 2026

岗位职责

在 Ling Team,我们不将算法与工程割裂看待。当模型进入万亿参数、百万亿 token、万卡级集群规模时:

  • 架构设计就是系统设计,
  • 训练范式就是分布式问题。 本岗位聚焦 算法 × 工程 co-design,你将深度参与模型架构、预训练与强化学习训练范式的系统级落地与共创。我们寻找的不是“支持算法”的工程师,而是能参与定义下一代训练范式的人。

主要职责包括:

  1. 模型架构 × 系统共设计
  • 参与 MoE / 混合 Attention / Linear Attention 等架构的并行策略设计;
  • 设计 EP × TP × CP x PP x DP 等多维并行协同机制;
  • 构建高效 KV cache、激活重算与内存调度策略;
  • 在架构设计阶段建模通信复杂度与可扩展性;
  • 推动 FP8 / FP4 混合精度在全链路落地。
  1. 超大规模预训练系统建设
  • 构建百万亿 token 级数据供给与动态采样编排系统;
  • 优化 Optimizer × 通信 × 计算协同机制;
  • 构建长上下文训练(1M+)的系统级支撑能力;
  • 设计万卡级分布式训练架构与通信调度优化方案。
  1. 强化学习与 Agentic 训练优化
  • 优化超大规模 RL 训推系统性能;
  • 长轨迹 Agentic RL 训练效率优化;
  • 大规模 Agent 环境自动化构建和资源管理;
  • 持续迭代 Reasoning、Agentic、multi-agent RL 的框架。

任职要求

  1. 深入理解分布式训练体系(TP / PP / SP / EP / CP 等);
  2. 熟悉主流大模型训练框架底层实现(Megatron / DeepSpeed / FSDP 等);
  3. 熟悉 CUDA / NCCL / 通信优化原理;
  4. 能从算法目标反推系统架构设计;
  5. 具备从第一性原理推导系统设计的能力;
  6. 对 scaling law 与系统瓶颈具有直觉判断;
  7. 敏捷思维与良好协作能力,能与算法研究员进行深度技术对话。

加分项:

  1. 有 100B 以上 MoE 模型预训练系统经验;
  2. 有强化学习 / RLHF / Agentic 训练系统经验;
  3. 有 FP8 / FP4 混合精度工程落地经验;
  4. 有长上下文(100K+)训练与推理优化经验;
  5. 有超大规模集群稳定性与容错系统设计经验;
  6. 对算子融合与 kernel 级优化有实践经验;
  7. 在顶会 / 顶刊发表过系统或架构相关论文;
  8. 各类高水平竞赛金牌选手。

特色标签

1M上下文、Agentic训练、Attention缓存、C/C++、CUDA算子、FP4精度、FP8精度、Kernel融合、NCCL优化、Python、RLHF、RL训练、Sparse MoE、万亿参数模型、万卡级训练、专家混合网络、云服务、云计算、低精度计算、分布式计算、分布式训练、千亿级模型、参加算法相关竞赛/获奖、发表算法相关优秀论文、大模型算法、并行计算、并行训练框架、强化学习、数据采样系统、模型加速/性能优化、混合专家模型、百万亿token系统、算法工程化经验、缓存优化、网络拓扑优化、计算图优化、训练数据管道、超大模型、超长文本训练、键值缓存、长序列训练、集合通信、集群训练