阿里云智能-AI Infra 高级 SRE-杭州

Company Aliyun

Focus Tech · Algorithm

Location 杭州

Published October 9, 2026

岗位职责

  1. 负责 GPU/异构计算集群的交付、上线、变更和日常运维,保障AI Infra稳定运行。
  2. 参与 AI 基础设施运维平台建设,推动监控告警、故障诊断、故障自愈和变更管理等能力落地。
  3. 建立并持续优化 SLI、SLO、SLA 和应急响应机制,参与重大故障处置、复盘及改进闭环。
  4. 制定集群交付标准和运维规范,通过自动化工具与平台减少重复操作,提升交付效率和资源可用率。
  5. 协同研发、硬件厂商及内外部合作伙伴推进项目交付,识别并解决项目中的稳定性和效率问题。
  6. 主动发现系统风险和运维痛点,能够独立分析问题、推动改进并对结果负责。

任职要求

  1. 3年及以上互联网、云计算或数据中心基础设施运维经验,具有 GPU 集群、AI 训练平台或大规模计算集群经验者优先。
  2. 熟悉 Linux 操作系统、TCP/IP等基础技术,具备较强的系统、网络和性能问题排查能力;熟悉 Kubernetes、Slurm、LSF 等一种或多种集群调度系统,了解容器运行时、资源调度和任务生命周期管理。
  3. 了解 GPU、RDMA/RoCE/InfiniBand、高性能存储等 AI 基础设施关键技术,能够定位常见软硬件故障。
  4. 掌握 Python、Shell、Go 等至少一种编程语言,能够将运维经验沉淀为自动化工具或平台能力。
  5. 具备技术热情和好奇心,自驱力和学习力强;具备良好的分析与解决问题的能力;具备良好的沟通协作和项目推进能力,能够独立承担中等复杂度项目及跨团队保障任务;积极乐观,坚韧抗压,结果导向,能够持续推动问题的解决和突破。
  6. 掌握AI基础知识,掌握基础提示词工程,会使用Al专业工具,集成AI到个人工作流;有AI相关开发工具应用研发经验者优先,持有阿里云ACA/ACP/ACE认证证书者优先。

岗位标签

NEW