大模型训练平台研发工程师

Company Mihoyo

Focus Tech · Algorithm

Location 上海, 北京

Published January 7, 2026

岗位职责

  1. 负责大模型训练平台的架构设计与研发,支撑千卡/万卡级别的分布式训练任务调度与资源管理

  2. 基于 Kubernetes 构建和优化云原生 AI 基础设施,包括自定义 Operator/CRD 开发,实现训练任务的自动化编排、弹性伸缩与故障自愈

  3. 负责 GPU 资源池化、调度优化(如 Gang Scheduling、拓扑感知调度),提升集群整体利用率

  4. 建设训练平台的可观测性体系(监控、日志、Trace),快速定位训练任务中的性能瓶颈与硬件故障

  5. 与算法团队紧密协作,优化训练框架(PyTorch/Megatron/DeepSpeed等)与平台的集成效率,保障大规模训练任务的稳定性与吞吐

  6. 参与多云/混合云环境下的 K8s 集群管理与统一调度能力建设

  7. 推动平台工程效能提升,包括镜像构建加速、Checkpoint 管理、故障节点自动隔离与替换等机制

任职要求

  1. 本科及以上学历,计算机、软件工程等相关专业,5年以上后端/基础设施研发经验

  2. 深入理解 Kubernetes 原理与生态,具备 Operator/Controller/CRD 开发经验,熟悉 client-go

  3. 熟悉云原生技术栈:容器化(Docker/containerd)、服务网格、Helm、Prometheus/Grafana 监控体系

  4. 具备大规模 GPU 集群管理经验,熟悉 NVIDIA GPU 相关技术(CUDA、NCCL、GPU 拓扑、MIG 等)优先

  5. 了解分布式训练框架原理(数据并行/模型并行/流水线并行),有 PyTorch Distributed、Megatron-LM、DeepSpeed 等框架对接经验者优先

  6. 熟悉调度器原理,有 Volcano、Kueue、Slurm 等批处理调度系统使用或二次开发经验者优先

  7. 熟练使用 Go 或 Python 进行系统级开发,具备良好的工程规范与问题排查能力

  8. 有超大规模集群(千节点以上)运维/开发经验者优先,有从0到1搭建AI基础设施平台经验者优先