jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

智能引擎-KV Cache 存储系统开发-杭州

Company Alibaba

Focus Tech · Algorithm

Location 杭州

Published August 3, 2026

岗位职责

  1. KVCache 核心系统研发,负责 LLM 推理场景下 KVCache 的架构设计与工程实现,优化 KVCache 的内存管理、显存分配与生命周期调度策略,研究并实现 Prefix Cache、Radix Tree Cache 等高效缓存复用机制,提升 Cache Hit Rate。
  2. 设计跨机、跨节点的分布式 KVCache 共享与迁移方案,实现 KVCache 在 GPU HBM / CPU DRAM / NVMe SSD 多级存储间的高效卸载(Offload)与加载,针对长上下文、多轮对话场景优化 KVCache 的存储与传输效率。
  3. 推理性能优化,结合 Continuous Batching、PagedAttention、Chunked Prefill 等机制,协同优化 KVCache 调度策略,分析推理链路中 KVCache 相关的性能瓶颈,进行端到端性能优化,针对主流推理框架(vLLM / SGLang / TensorRT-LLM / RTP-LLM)进行 KVCache 模块的深度优化与定制。
  4. 系统可靠性与可观测性建设,建设 KVCache 命中率、内存占用、调度延迟等核心指标的监控体系,保障大规模集群下 KVCache 服务的高可用与容错能力。

任职要求

  1. 扎实的系统编程能力,精通 C++/Python,熟悉高性能并发编程与内存管理。
  2. 深入理解 KVCache 相关技术,PagedAttention / vAttention 等显存分页管理,Prefix Cache / Semantic Cache 等缓存复用技术,KVCache 量化(INT8/FP8 KV)压缩技术,KVCache Offload 至 CPU/SSD 的分层存储技术。
  3. 理解 LLM 推理原理,熟悉 Transformer 架构及 Attention 计算机制,熟悉主流 LLM 推理框架。
  4. 熟悉 CUDA 编程,了解 GPU 显存管理、PCIe/NVLink 传输机制。
  5. 加分项:有在 vLLM / SGLang / Mooncake 等开源项目贡献 KVCache 相关 PR 的经验,熟悉存储系统(Ceph / 3FS)或分布式缓存系统(Redis / Memcached)设计原理。

岗位标签

NEW

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.