大模型MaaS平台系统工程师
Company Kuaishou
Focus Tech · Algorithm
Location 北京
Published September 24, 2026
岗位职责
- 负责大模型 MaaS 平台核心后端能力建设,支撑公司内外部大模型推理、部署、调用与运维场景;
- 负责大模型推理服务的稳定性体系建设,包括高可用架构、限流降级、熔断容灾、故障自愈、容量治理、SLA 保障等;
- 负责大模型推理流量调度能力建设,包括多模型、多集群、多地域、多租户场景下的流量路由、负载均衡、灰度发布、弹性调度与成本优化;
- 负责模型服务编排与部署系统建设,支持模型实例生命周期管理、自动化部署、版本管理、滚动升级、弹性伸缩、资源隔离与异构资源调度;
- 深入优化推理链路的性能与资源利用率,包括请求排队、批处理、缓存、并发控制、GPU/CPU 资源利用、延迟与吞吐优化等;
- 建设平台可观测能力,包括指标、日志、链路追踪、告警、故障诊断工具和稳定性运营看板,提升问题发现、定位和恢复效率;
- 与算法、基础架构、业务团队协作,抽象通用平台能力,推动大模型能力标准化、产品化和规模化落地;
- 参与平台架构设计与技术演进,保障系统在高并发、高可用、多租户和复杂业务场景下的稳定运行。
任职要求
-
本科及以上学历,计算机、软件工程、人工智能等相关专业;
-
具备扎实的计算机基础,熟悉操作系统、网络、分布式系统、数据结构与算法;
-
熟悉 Java / Go / Python / C++ 至少一种后端开发语言,具备良好的工程实践能力和代码质量意识;
-
熟悉微服务架构,具备高并发、高可用系统设计经验,理解限流、熔断、降级、重试、超时控制、负载均衡等稳定性治理手段;
-
熟悉 Kubernetes、容器化、服务编排、服务发现、弹性伸缩、资源调度等云原生技术;
-
熟悉监控告警、日志分析、链路追踪等可观测体系,有线上问题排查和稳定性治理经验;
-
具备良好的系统抽象能力和问题拆解能力,能够在复杂业务和技术约束下设计可落地、可演进的平台方案;
-
具备良好的沟通协作能力,能够与算法、业务、基础架构等多角色团队高效协作。 加分项:
-
有大模型推理平台、MaaS 平台、AI Infra、模型部署平台、在线推理服务相关经验;
-
熟悉 vLLM、Triton Inference Server、TensorRT-LLM、Ray Serve、KServe、Seldon、TorchServe 等推理或模型服务框架;
-
熟悉大模型推理优化技术,如动态 batching、KV Cache、Prefix Cache、Speculative Decoding、PagedAttention、多卡并行、量化等;
-
有 GPU 集群调度、异构资源管理、弹性伸缩、成本优化相关经验;
-
有多租户平台、企业级 PaaS / SaaS 平台、API Gateway、服务网格或流量治理系统建设经验;
-
有大规模在线系统稳定性建设经验,参与过核心链路 SLA 保障、故障治理、容量规划或应急体系建设;
-
对大模型工程化落地有深入理解,关注模型服务性能、稳定性、成本和体验之间的平衡。