阿里云智能-服务器AI互连技术开发专家-北京/上海Company AliyunFocus Tech · BackendLocation 北京, 上海Published August 21, 2026岗位职责 参与超节点集群推理训练性能调优:深入AI大模型训练/推理业务场景,针对高密度并行算力流量与内存扩展访存特征,定位并解决性能瓶颈。 可靠性与稳定性体系建设,涵盖异常流量抑制、自愈机制设计,系统性降低组网故障概率。构建质量保障体系,设计多级流量优先级调度、拥塞调度。 Scale-Up通信软件优化,包括软件研发与交付,如推理卡间通信、KV Cache优化。 评测体系与极限验证:搭建数据面性能基线、面向通信库、池化内存扩展评测体系,为软件迭代与架构演进提供量化依据。 参与具备竞争力的下一代基础设施架构定义:结合GPU互连技术演进与AI算力业务需求,参与下一代Scale-Up超节点互连架构、内存池化方案及数据面协议的设计与预研。 任职要求 计算机、软件工程、电子科学与技术、人工智能等相关专业。 5年以上软件研发或系统架构设计经验,精通C++或Python等编程语言,具备扎实的底层系统开发能力。 具备丰富的性能分析与优化经验,能独立完成系统性能瓶颈定位及调优。 有强烈的技术热情和好奇心、自驱力和学习力;具备良好的分析与解决问题能力、沟通以及团队合作能力;有创新热情,积极乐观,能够持续推动问题的解决和突破。 掌握AI基础知识,熟练使用主流AI Coding工具,熟悉AI驱动的研发流程并能融入个人工作流;有AI相关开发工具应用研发经验者优先,持有阿里云ACA/ACP/ACE认证证书者优先。 加分项(满足一个或多个) 熟悉AI推理或者训练框架,或有大规模集群性能调优实战案例者优先。 有GPU集群通信优化经验,熟悉集合通信库底层原理者优先。 熟悉网络监控指标体系、可观测平台、告警治理与基线建设者优先。 有高速接口性能优化经验,熟悉Scale-Up互连,或PCIe、RDMA、CXL技术者优先。 熟悉互连Fabric 组网、路由协议与集群管控方案者优先。 熟悉大集群网络稳定可靠性容灾者优先。 有CUDA编程及GPU内存访问优化经验者优先。