GPU 集群 SRE 工程师(稳定性治理)
Company Mihoyo
Focus Tech · Backend
Location 上海
Published January 7, 2026
岗位职责
- 稳定性治理体系:制定平台与业务两层的 SLO 目标与度量口径;建立容量水位、变更管控、灰度发布与稳定性度量机制;担任业务上线前稳定性评审的把关人,推动线上风险项的收敛闭环;
- 告警与 oncall:在已有监控能力之上建设分级告警体系,设计依赖抑制、聚合去重、静默与防风暴机制;建设告警路由与分发策略,把硬件与平台事件归因为业务可理解的影响面;建设 oncall 响应机制(排班、升级链路、处置留痕、故障演练),沉淀 SOP 与应急预案,并把复盘结论回流为告警规则与巡检项;
- 故障定位与根因分析:负责 P0/P1 故障的定位、根因分析与改进项跟踪,覆盖 GPU 硬件(掉卡、显存异常、降频)、网络互联(通信退化、拥塞)、存储与调度链路;
- 可观测能力的承接与演进:承接平台已建成的可观测底座,负责指标口径的统一定义与治理,实现一处定义、多处消费(大盘 / 告警 / 分析 / 计费);补齐推理侧(TTFT、TPOT、端到端延迟、KV Cache 水位、错误率)与训练侧(吞吐、MFU、通信效率、慢节点检测)的观测盲区;
- 资源效率治理(协同):配合公司层面的 GPU 资源效率治理专项,提供集群 / 队列 / 业务多维度的用量与效率数据;落地低利用率治理、排队治理、配额腾挪与资源回收等集群侧动作;参与容量规划,为扩容决策提供数据依据;
任职要求
- 本科及以上学历,计算机相关专业,5 年以上 SRE / 云原生平台 / 大规模集群运维经验,其中 GPU 或异构算力集群相关 2 年以上;
- 具备完整的 SRE 工程实践经验,且主导落地过其中至少两项:SLO 定义与度量、告警治理、oncall 体系、变更管理、故障演练与复盘改进;
- 熟悉 NVIDIA GPU 软件栈(驱动、CUDA、NCCL、DCGM),具备掉卡、显存异常、通信退化与性能问题的定位经验;
- 熟悉 RoCE / InfiniBand 组网,有 PFC/ECN 调优与网络侧故障排查经验;
- 深入理解 Kubernetes 与云原生生态,有生产级集群运维与故障排查经验;熟悉 Volcano / Kueue / Koordinator 等 AI 批调度框架,理解配额与队列管理机制;
- 熟练掌握 Prometheus / Grafana,理解指标口径设计、高基数问题与告警治理方法;
- 熟练掌握 Go 或 Python,有自动化工具开发能力(exporter、数据聚合服务、巡检与自愈工具等);
- Linux 系统能力扎实,熟悉 perf / eBPF 等性能分析工具;
- 良好的跨团队沟通与推动能力;