【Plan A】超大规模复杂训推系统方向-27届

Campus

Company Antgroup

Focus Tech · Other

Location 北京, 上海, 杭州

Published September 3, 2026

岗位职责

支撑5T模型与10万+卡规模集群及持续数小时、数天甚至更长周期的 Agentic RL,研究超长上下文 Rollout 下的 KV Cache 管理、动态批处理、异步调度、多维负载均衡、长程状态保存和细粒度容错;协同优化模型并行、专家并行、计算通信 Overlap、低精度训练与关键算子,突破大规模智能训练的效率和稳定性瓶颈。

任职要求

  1. 编程与工程素养:精通 Python/C++,代码风格优秀;对底层系统有深入钻研的兴趣与技术好奇心;
  2. 分布式训练体系:深入理解分布式系统与并行计算;熟练掌握 TP/PP/SP/EP/CP/FSDP 等并行机制,具备千卡级以上实战经验;
  3. 大模型框架:熟练使用 PyTorch,理解自动微分底层;熟悉 Megatron-LM/DeepSpeed/vLLM/SGLang 等至少两种框架的底层实现;
  4. 底层硬件与通信优化:熟悉 CUDA/CUTLASS 算子开发;深入理解 NCCL 通信优化与集群拓扑;
  5. 系统分析与建模:能从第一性原理推导系统设计;对 Scaling Law、分布式性能瓶颈有深入理解,具备数学建模能力。

加分项:

  1. 有 100B 以上 MoE 模型预训练系统经验;
  2. 有 FP8 / FP4 混合精度工程落地经验;
  3. 有长上下文(100K+)训练与推理优化经验;
  4. 有超大规模集群稳定性与容错系统设计经验;
  5. 对算子融合与 kernel 级优化有实践经验;
  6. 熟悉至少一种主流的RLHF框架,如OpenRLHF/veRL/AReal/ChatLearn等,熟悉Ray框架或其他强化学习相关计算框架;
  7. 在计算机系统网络顶会OSDI/SOSP/NSDI/ATC/EuroSys上有文章发表经验;
  8. 各类高水平竞赛金牌选手。

特色标签

C++、C/C++、Cache管理、CUDA kernel、CUTLASS算子、DeepSpeed、FP4训练、FP8训练、FSDP、Linux开发/部署经验、Megatron-LM、Python、PyTorch、SGLang、vLLM、专家并行、云原生、云服务、云计算、分布式并行训练、分布式经验、分布式计算、分布式训练、动态批调度、参加算法相关竞赛/获奖、发表算法相关优秀论文、基础设施、多维度负载均衡、大模型算法、大规模并行训练、并行计算、序列并行、异步任务调度、张量并行、强化学习、拓扑感知通信、数据并行、智能体、有留学背景、机器学习经验、模型加速/性能优化、流水线并行、混合精度训练、混合负载均衡、算子融合、算法工程化经验、系统架构设计经验、自适应批处理、计算机相关专业、键值缓存、长上下文缓存、集合通信优化、集群并行训练、集群通信库、非阻塞调度