大模型训练平台研发工程师
Company Mihoyo
Focus Tech · Algorithm
Location 上海, 北京
Published January 7, 2026
岗位职责
-
负责大模型训练平台的架构设计与研发,支撑千卡/万卡级别的分布式训练任务调度与资源管理
-
基于 Kubernetes 构建和优化云原生 AI 基础设施,包括自定义 Operator/CRD 开发,实现训练任务的自动化编排、弹性伸缩与故障自愈
-
负责 GPU 资源池化、调度优化(如 Gang Scheduling、拓扑感知调度),提升集群整体利用率
-
建设训练平台的可观测性体系(监控、日志、Trace),快速定位训练任务中的性能瓶颈与硬件故障
-
与算法团队紧密协作,优化训练框架(PyTorch/Megatron/DeepSpeed等)与平台的集成效率,保障大规模训练任务的稳定性与吞吐
-
参与多云/混合云环境下的 K8s 集群管理与统一调度能力建设
-
推动平台工程效能提升,包括镜像构建加速、Checkpoint 管理、故障节点自动隔离与替换等机制
任职要求
-
本科及以上学历,计算机、软件工程等相关专业,5年以上后端/基础设施研发经验
-
深入理解 Kubernetes 原理与生态,具备 Operator/Controller/CRD 开发经验,熟悉 client-go
-
熟悉云原生技术栈:容器化(Docker/containerd)、服务网格、Helm、Prometheus/Grafana 监控体系
-
具备大规模 GPU 集群管理经验,熟悉 NVIDIA GPU 相关技术(CUDA、NCCL、GPU 拓扑、MIG 等)优先
-
了解分布式训练框架原理(数据并行/模型并行/流水线并行),有 PyTorch Distributed、Megatron-LM、DeepSpeed 等框架对接经验者优先
-
熟悉调度器原理,有 Volcano、Kueue、Slurm 等批处理调度系统使用或二次开发经验者优先
-
熟练使用 Go 或 Python 进行系统级开发,具备良好的工程规范与问题排查能力
-
有超大规模集群(千节点以上)运维/开发经验者优先,有从0到1搭建AI基础设施平台经验者优先