大模型推理服务可靠性工程师

Company Mihoyo

Focus Tech · Algorithm

Location 上海

Published January 7, 2026

岗位职责

岗位定位 负责 LLM 推理服务全链路的稳定性,让模型、框架、Router、网关等每个环节都处于可控、可观测、可回滚、可恢复、可容灾的状态;通过持续容灾演练和自研工具/系统,持续提升推理系统的可靠性与运维效率。

职责

  1. 负责推理服务的部署与发布稳定性:建立覆盖模型/框架/Router/网关的可观测、灰度、回滚、恢复机制,对推理服务的可用性与核心SLO(TTFT/TPOT/成功率)负责。

  2. 建设和维护推理全链路监控体系:从推理、网络、Workload 三个维度建设黄金指标与看板,能从网关 → Router → Runtime → GPU/NCCL逐层下钻定位问题。

  3. 承担 On-call,作为 P0/P1 故障 IC 主导定位、止血、恢复与复盘,持续压降 MTTR。

  4. 制定并执行容灾演练计划:覆盖多 AZ/多集群故障转移、GPU/NCCL/网关/Router 等故障注入,推动发现的韧性缺陷闭环修复。

  5. 开发和迭代运维工具/平台(如一键切流/回滚、自动巡检、自愈规则、故障注入平台、容量与流量水位看板),提升运维自动化率。

  6. 负责容量与水位管理:基于流量趋势和 workload 特征做容

  7. 编写 Runbook、Postmortem 与故障案例库,沉淀诊断方法与工具。

任职要求

必须满足:

  • 计算机相关专业本科及以上,3 年以上 SRE / 运维开发 / 稳定性相关经验。
  • 熟练使用 Kubernetes:有实际的 K8s 集群运维或平台使用经验(Pod/Deployment/Service/HPA/调度/排障)。
  • 有 SRE 方法论实践:On-call 机制、监控告警、SLO/错误预算、故障应急响应。
  • 具备工具/系统开发能力:熟练使用 Python 或 Go 编写运维工具、自动化脚本或平台。