阿里云智能-虚拟化系统研发专家(Hypervisor & AI Infra)-杭州Company AliyunFocus Tech · AlgorithmLocation 杭州Published August 23, 2026岗位职责 主导/参与面向 Intel/AMD/ARM 新一代服务器平台的虚拟化核心模块研发,完成新硬件特性在 Dragonfly Hypervisor 中的使能与深度优化; 设计并实现虚拟化下高性能、轻量级VMM方案,支撑 AI 训练/推理、Agent 沙箱等新型负载的隔离性、性能与启动速度; 研发与优化软硬协同的隔离方案(内存/IO/中断/设备粒度),提升多租户场景下的安全性、确定性与资源保障能力; 基于神龙硬件平台,设计并落地加速卸载方案,持续降低虚拟化开销、提升端到端吞吐与延迟; 持续演进热迁移/热升级/热插拔技术,在百万级实例规模下保障业务零感知、高成功率、秒级收敛; 构建虚拟化可信执行环境(vTPM/TCM 集成、机密计算支持、启动度量与远程证明),打造云上可信基础设施底座; 深入客户一线,主导复杂性能瓶颈分析、稳定性根因定位与系统级调优,输出可复用的方法论与工具链; 参与下一代 Dragonfly Hypervisor 的架构设计——面向 AI Infra 与 Agent 运行时需求,定义轻量、弹性、可扩展、可观测的新一代虚拟化范式。 任职要求 5年以上相关工作经验,计算机或相关专业,有大型云厂商虚拟化/内核/系统软件研发经历,或主导过从0到1的虚拟化模块设计与落地优先; 熟悉 x86 或ARM、RISC-V 体系结构,深入理解 CPU/内存/中断/IO 虚拟化原理;精通 Linux 内核关键子系统(调度、内存管理、cgroups、RAS),具备内核态开发与深度调试(kdump/ftrace/perf)实战经验优先; 具备扎实的 C/C++ 编程能力,熟悉 QEMU/KVM/Xen 等主流开源虚拟化项目源码者优先; 有神龙平台、智能网卡(DPU)、GPU/ASIC 加速卡、DPDK/SPDK 开发或协同优化经验优先; 熟悉容器运行时底层(gVisor/Kata/Firecracker/Rust VMM)、eBPF、安全容器(Nabla、gVisor sandbox)或可信计算(TPM/vTPM、SGX、TDX)优先; 具备 AI 工作负载(PyTorch/Triton/LLM 推理)在虚拟化环境下性能调优或资源隔离实践经验优先; 有强烈技术热情和好奇心,自驱力和学习力强;具备良好的分析与解决问题的能力、沟通以及团队合作能力;喜欢挑战性的技术研发工作,善于攻坚克难,有创新热情,积极乐观,坚韧抗压,结果导向,能够持续推动问题的解决和突破; 掌握AI基础知识,掌握基础提示词工程,会使用Al专业工具,集成AI到个人工作流;有AI相关开发工具应用研发经验者优先,持有阿里云ACA/ACP/ACE认证证书者优先。