大模型推理平台研发工程师

Company Mihoyo

Focus Tech · Algorithm

Location 上海, 北京

Published January 7, 2026

岗位职责

岗位职责:

  1. 负责大模型推理平台的开发、维护与性能优化,保障服务高可用性和高性能运行

  2. 对大模型 KVCache 集群进行开发、维护与性能调优,解决大规模并发推理内存瓶颈

  3. 管理推理服务的计算资源、流量及任务调度,优化集群资源利用率,降低推理成本

  4. 建立推理服务监控告警体系,及时发现和解决性能异常和系统故障

  5. 参与推理服务架构设计,支持多模态模型和不同规模模型的推理需求

任职要求

岗位要求:

  1. 计算机相关专业,本科及以上学历,3-5 年分布式系统或AI推理相关工作经验

  2. 具备丰富的推理服务性能优化经验:KVCache 管理、调度策略优化、PD 分离、模型量化、模型并行等

  3. 熟练使用 Kubernetes 进行容器化部署,了解 Volcano等GPU资源调度系统

  4. 掌握 Go/Python 等编程语言,具备良好的代码规范和系统设计能力

  5. 具备推理链路端到端性能分析与故障排查能力,能够在高并发、大规模场景下保障服务稳定运行

  6. 熟悉至少一种大模型推理主流框架(vLLM、SGLang、TensorRT-LLM、Dynamo等)

  7. 良好的团队协作能力和独立解决复杂问题的能力,能承受一定工作压力