大模型训推平台开发工程师

Company Mihoyo

Focus Tech · Algorithm

Location 上海, 北京

Published January 7, 2026

岗位职责

  1. NVL72 内部 GPU 拓扑(机柜内 NVLink fabric、Compute tray ↔ NVSwitch tray 关系、跨柜 rail)的发现、上报与节点标签化

  2. K8s 调度器(Volcano 二次开发 + kube-scheduler framework)的 GB300 rail-aligned 调度策略、Gang Scheduling 适配、跨柜 binpack / spread 策略实现与上线

  3. 训练任务启动器(Launcher)的 NVL72 拓扑注入、ENV 配置、NCCL_TOPO_FILE 自动生成

  4. Megatron-LM / DeepSpeed / PyTorch FSDP 在 NVL72 单机柜内的并行策略最佳实践(TP / PP / DP 切分边界与 NVLink 域对齐)

  5. NCCL 在 NVL72 内部高带宽(NVLink 5)+ 跨柜 RDMA 混合拓扑下的深度调优:算法选择(ring / tree / NVLS)、QP 数、buffer 大小、IB HCA 绑定

  6. 训练框架与 NCCL 的代码级 patch、问题上游回报与社区跟进

  7. NVL72 故障域(机柜级 NVLink down、NVSwitch tray 故障、Compute tray 故障)下的训练任务断点续训、整体重试与节点替换语义

  8. 训练任务级慢卡 / 慢柜检测:在 all-reduce 时延、step time、GPU SM/Mem 利用率等多维度做联合识别

  9. 与 Operator 组、硬件运维 GB300 专项组配合落地"机柜级故障 → 节点替换 → 训练续跑"端到端链路

任职要求

  • 计算机科学与技术、软件工程、人工智能等相关专业,本科及以上学历
  • 5 年以上分布式训练系统或 K8s 平台研发经验
  • K8s 调度:精通 kube-scheduler framework / scheduler plugins 机制,具备 Volcano 二次开发实战经验(Kueue / YuniKorn 等其他调度器有同等深度经验者亦可,但需对 Volcano 源码有独立阅读能力),理解 Gang Scheduling、队列、拓扑感知调度的实现
  • 分布式训练框架:精通 Megatron-LM / DeepSpeed / PyTorch FSDP 中至少一个的内部机制(数据并行 / 张量并行 / 流水并行实现、通信图、checkpoint 机制),具备千卡级训练任务调优实战经验
  • 通信库:深入理解 NCCL 内部(拓扑发现、ring / tree / NVLS 算法、QP 与 buffer 管理),具备 NCCL 参数调优与代码阅读能力
  • GPU 互连:熟悉 NVLink / NVSwitch / Fabric Manager 工作机制,理解 NVLink 域概念及其对训练并行策略的影响
  • RDMA:熟悉 RoCE / IB 协议栈基本概念(PFC / ECN / QP)
  • 编程语言:精通 Go 与 Python,其中 Go 需具备独立开发 K8s 控制器或调度器插件的能力
  • 良好的工程素养与跨团队协作能力,能够主导 P0 训练事件复盘并沉淀技术文档