阿里云智能-AI Infra SRE 专家-杭州
Company Aliyun
Focus Tech · Algorithm
Location 杭州
Published October 9, 2026
岗位职责
- 负责大规模 GPU/异构计算集群稳定性架构和运维体系设计,对集群可用性、交付效率、资源利用率和运维成本负责。
- 主导 AI 基础设施运维平台的架构设计与建设,形成覆盖交付、监控、诊断、变更、容量、容灾和故障自愈的工程体系。
- 建立面向 AI 训练与推理场景的 SLI、SLO、SLA 及稳定性度量体系,推动重大故障治理和系统性风险消除。
- 主导集群交付标准、运维规范和质量准入机制建设,推动跨地域、跨团队场景下的标准化复制。
- 牵引复杂项目和重大稳定性专项,协调研发、产品、硬件厂商及合作伙伴解决跨层技术问题。
- 持续识别架构瓶颈和业务风险,通过技术创新、自动化和平台化手段实现规模化效率提升。
- 指导团队技术建设和人才成长,沉淀最佳实践并提升团队整体工程能力。
任职要求
- 5年以上互联网、云计算或大规模基础设施相关经验,具有大型 GPU 集群、AI 训练平台或高性能计算平台建设经验。
- 深入理解 Linux、分布式系统、计算、网络和存储体系,具备复杂故障的跨层分析及性能优化能力;深入掌握 Kubernetes、Slurm、LSF 等调度系统,理解 GPU 资源调度、拓扑感知、任务容错和大规模集群治理。
- 熟悉 GPU、RDMA/RoCE/InfiniBand、NCCL、高性能存储等技术,能够分析训练任务稳定性、通信性能及软硬件协同问题。
- 具备较强的软件工程和平台架构能力,能够主导自动化运维、自愈系统或稳定性平台建设。有成熟的 SRE 体系建设经验,熟悉容量管理、变更管理、应急响应、故障复盘和风险治理。
- 具备技术热情和好奇心,自驱力和学习力强;具备良好的分析与解决问题的能力;具备良好的沟通协作和项目推进能力,能够独立承担中等复杂度项目及跨团队保障任务;积极乐观,坚韧抗压,结果导向,能够持续推动问题的解决和突破。
- 掌握AI基础知识,掌握基础提示词工程,会使用Al专业工具,集成AI到个人工作流;有AI相关开发工具应用研发经验者优先,持有阿里云ACA/ACP/ACE认证证书者优先。
岗位标签
NEW