大模型MaaS平台系统工程师

Company Kuaishou

Focus Tech · Algorithm

Location 北京

Published September 24, 2026

岗位职责

  1. 负责大模型 MaaS 平台核心后端能力建设,支撑公司内外部大模型推理、部署、调用与运维场景;
  2. 负责大模型推理服务的稳定性体系建设,包括高可用架构、限流降级、熔断容灾、故障自愈、容量治理、SLA 保障等;
  3. 负责大模型推理流量调度能力建设,包括多模型、多集群、多地域、多租户场景下的流量路由、负载均衡、灰度发布、弹性调度与成本优化;
  4. 负责模型服务编排与部署系统建设,支持模型实例生命周期管理、自动化部署、版本管理、滚动升级、弹性伸缩、资源隔离与异构资源调度;
  5. 深入优化推理链路的性能与资源利用率,包括请求排队、批处理、缓存、并发控制、GPU/CPU 资源利用、延迟与吞吐优化等;
  6. 建设平台可观测能力,包括指标、日志、链路追踪、告警、故障诊断工具和稳定性运营看板,提升问题发现、定位和恢复效率;
  7. 与算法、基础架构、业务团队协作,抽象通用平台能力,推动大模型能力标准化、产品化和规模化落地;
  8. 参与平台架构设计与技术演进,保障系统在高并发、高可用、多租户和复杂业务场景下的稳定运行。

任职要求

  1. 本科及以上学历,计算机、软件工程、人工智能等相关专业;

  2. 具备扎实的计算机基础,熟悉操作系统、网络、分布式系统、数据结构与算法;

  3. 熟悉 Java / Go / Python / C++ 至少一种后端开发语言,具备良好的工程实践能力和代码质量意识;

  4. 熟悉微服务架构,具备高并发、高可用系统设计经验,理解限流、熔断、降级、重试、超时控制、负载均衡等稳定性治理手段;

  5. 熟悉 Kubernetes、容器化、服务编排、服务发现、弹性伸缩、资源调度等云原生技术;

  6. 熟悉监控告警、日志分析、链路追踪等可观测体系,有线上问题排查和稳定性治理经验;

  7. 具备良好的系统抽象能力和问题拆解能力,能够在复杂业务和技术约束下设计可落地、可演进的平台方案;

  8. 具备良好的沟通协作能力,能够与算法、业务、基础架构等多角色团队高效协作。 加分项:

  9. 有大模型推理平台、MaaS 平台、AI Infra、模型部署平台、在线推理服务相关经验;

  10. 熟悉 vLLM、Triton Inference Server、TensorRT-LLM、Ray Serve、KServe、Seldon、TorchServe 等推理或模型服务框架;

  11. 熟悉大模型推理优化技术,如动态 batching、KV Cache、Prefix Cache、Speculative Decoding、PagedAttention、多卡并行、量化等;

  12. 有 GPU 集群调度、异构资源管理、弹性伸缩、成本优化相关经验;

  13. 有多租户平台、企业级 PaaS / SaaS 平台、API Gateway、服务网格或流量治理系统建设经验;

  14. 有大规模在线系统稳定性建设经验,参与过核心链路 SLA 保障、故障治理、容量规划或应急体系建设;

  15. 对大模型工程化落地有深入理解,关注模型服务性能、稳定性、成本和体验之间的平衡。