阿里云智能-服务器AI缓存技术开发专家-上海/北京Company AliyunFocus Tech · BackendLocation 北京, 上海Published August 21, 2026岗位职责 参与服务器与超节点内存扩展及共享优化整体技术架构设计,规划本地内存的分层架构与容量弹性扩缩机制,支撑数据中心各类应用如大模型、数据库等的解决方案研发。 研发面向数据中心应用(如KV Cache)的内存分层优化方案(如CPU DDR、CXL、GPU显存、RDMA内存等),以及在算力芯片(GPU、CPU)上的负载调优,提升业务性能。 研发基于内存扩展设备如GPU内存,CXL内存的驱动。 内存扩展与共享架构的可靠性与稳定性体系建设,涵盖内存故障隔离、异常访问抑制、切换自愈机制设计,系统性降低内存相关故障对集群的影响。 搭建内存全维度可观测与监控体系,建立基线、告警、故障机制。 跟进业界前沿内存分层共享内存技术演进,参与下一代基础设施定义。 任职要求 计算机、软件工程、电子科学与技术、人工智能等相关专业。 5年以上软件研发或系统架构设计经验,精通C++或Python等编程语言,具备扎实的底层系统开发能力。 具备丰富的性能分析与优化经验,能独立完成系统性能瓶颈定位及调优。 有强烈技术热情和好奇心、自驱力和学习力;具备良好的分析与解决问题能力、沟通以及团队合作能力;有创新热情,积极乐观,能够持续推动问题的解决和突破。 掌握AI基础知识,熟练使用主流AI Coding工具,熟悉AI驱动的现代研发流程并能融入个人工作流;有AI相关开发工具应用研发经验者优先,持有阿里云ACA/ACP/ACE认证证书者优先。 加分项(满足一个或多个) 熟悉数据中心应用如AI训练推理、数据库、分布式存储,有大规模分布式内存或存储系统设计经验者优先。 具备分布式系统与分布式内存架构能力,深入理解分布式共享内存、全局地址空间、分布式一致性者优先。 理解大模型训练/推理的内存与显存需求特征,熟悉 KV Cache 管理、长上下文场景下的内存优化机制,有相关落地或优化者优先。 熟悉操作系统内存管理机制,包括虚拟内存、页表与地址映射、页迁移/回收、分层内存等者优先。 熟悉CXL内存扩展与内存池化技术,具备CXL系统搭建或驱动设计或内核使能经验,以及相关方案设计或落地经验者优先。 了解CPU对于分层内存负载的优化方案,包括如延迟优化、热冷页迁移等优先。