大模型推理平台研发工程师
Company Mihoyo
Focus Tech · Algorithm
Location 上海, 北京
Published January 7, 2026
岗位职责
岗位职责:
-
负责大模型推理平台的开发、维护与性能优化,保障服务高可用性和高性能运行
-
对大模型 KVCache 集群进行开发、维护与性能调优,解决大规模并发推理内存瓶颈
-
管理推理服务的计算资源、流量及任务调度,优化集群资源利用率,降低推理成本
-
建立推理服务监控告警体系,及时发现和解决性能异常和系统故障
-
参与推理服务架构设计,支持多模态模型和不同规模模型的推理需求
任职要求
岗位要求:
-
计算机相关专业,本科及以上学历,3-5 年分布式系统或AI推理相关工作经验
-
具备丰富的推理服务性能优化经验:KVCache 管理、调度策略优化、PD 分离、模型量化、模型并行等
-
熟练使用 Kubernetes 进行容器化部署,了解 Volcano等GPU资源调度系统
-
掌握 Go/Python 等编程语言,具备良好的代码规范和系统设计能力
-
具备推理链路端到端性能分析与故障排查能力,能够在高并发、大规模场景下保障服务稳定运行
-
熟悉至少一种大模型推理主流框架(vLLM、SGLang、TensorRT-LLM、Dynamo等)
-
良好的团队协作能力和独立解决复杂问题的能力,能承受一定工作压力