大模型推理平台工程师(资源调度方向)

Company Mihoyo

Focus Tech · Algorithm

Location 上海

Published January 7, 2026

岗位职责

  1. 负责大模型推理平台的设计与建设,支撑多模型、多租户、多业务场景下的推理服务部署、资源调度、弹性伸缩、灰度发布、故障自愈和稳定性治理。
  2. 负责推理工作负载的平台化抽象与工程落地,建设面向分布式推理、多副本推理和多角色协同服务的生命周期管理能力,提升推理服务的部署效率、运维效率和稳定性。
  3. 负责异构算力资源管理、多集群调度和服务性能优化能力建设,持续提升大规模推理场景下的资源利用率、模型加载效率、服务启动速度、可观测能力和整体交付效率。

任职要求

  1. 本科及以上学历,计算机、软件工程、人工智能、分布式系统、云计算等相关专业优先。
  2. 熟练掌握 Go / Python / Rust 中至少一种语言,具备良好的工程实现、系统设计和问题排查能力。
  3. 熟悉 Kubernetes / Docker / Helm 等云原生技术,理解 Deployment、StatefulSet、Service、Ingress、HPA、CRD、Operator 等核心机制。
  4. 具备 Kubernetes Operator / Controller 开发经验,熟悉 controller-runtime、client-go、Informer、Reconcile 等机制。
  5. 熟悉 Kubernetes 调度体系,理解亲和性、污点容忍、拓扑分布、优先级、抢占、资源配额等机制。
  6. 熟悉 LWS / RBG 等面向大模型推理的多 Pod 协同工作负载项目,理解 Leader / Worker 架构、Group 化管理、滚动升级、故障恢复和弹性扩缩容等机制。
  7. 熟悉大模型推理服务的核心特性,包括 KV Cache、PagedAttention、Continuous Batching、Prefix Cache、Speculative Decoding、Chunked Prefill、PD 分离、TP / PP / EP 等。
  8. 熟悉至少一种主流推理引擎,如 vLLM、SGLang、TensorRT-LLM、TGI、LMDeploy 等,了解其部署方式、关键参数、资源需求和性能瓶颈。
  9. 具备大规模模型服务部署和调度经验,理解多模型、多副本、多租户、高并发场景下的容量评估、资源隔离、弹性伸缩和稳定性治理。
  10. 熟悉 GPU / NPU 等异构硬件资源管理,了解 NVIDIA GPU、MIG、NVLink、RDMA、RoCE、拓扑亲和性、显存管理等机制。
  11. 熟悉 Prometheus / Grafana / OpenTelemetry / Loki / ELK 等可观测体系,能够定位推理服务性能和稳定性问题。
  12. 具备良好的系统抽象能力、问题分析能力和跨团队沟通能力,能够与算法、模型、业务、SRE、基础设施团队协作推进平台能力落地。