阿里云智能-灵骏AI Infra算力集群稳定性平台研发专家-杭州

Company Aliyun

Focus Tech · Algorithm

Location 杭州

Published October 9, 2026

岗位职责

  1. 建设覆盖灵骏智算集群、超节点、节点、硬件与网络的统一健康诊断、自愈与智能故障治理体系,围绕算力可用性、故障恢复效率、规模运维效率等目标,构建“异常快速发现-智能根因分析-故障自愈处置”的闭环系统。
  2. 建设超节点Scale-Up网络全生命周期管理与全链路监控自愈系统,构建超节点Scale-Up设备管理、Scale-Up网络故障发现与自愈处置、Scale-Up网络压测、Scale-Up网络仿真模拟平台等核心能力。
  3. 建设智算组件版本管理与变更控制系统,构建核心系统能力,实现组件版本可管理、兼容关系可校验、变更过程可控制、执行结果可追溯的目标。
  4. 持续跟踪AI智算、云原生及智能运维领域新技术,结合业务场景进行创新。
  5. 该职位涉及值班响应的职责,在服务级别协议(SLA)时间内做出对客响应,推动客户问题的解决,改善客户体验。

任职要求

  1. 拥有5年以上大规模分布式系统设计及研发经验,独立负责过包含多模块的业务子系统,包括接口定义、架构设计及关键分布式问题的技术方案细化等工作。
  2. 编程基本功扎实,熟悉数据结构和算法,熟练掌握Golang/Java/Python/C++中至少一种开发语言。
  3. 系统工程能力扎实过硬,线上稳定性意识强,对于复杂的线上系统具备较强的技术敏感度和故障排查经验;有过线上系统监控体系、变更体系/流程设计和研发经验者优先。
  4. 业务感觉良好,有具有出色的抽象设计能力,思路清晰,善于思考,能独立分析和解决问题,能够主导并驱动完整的技术产品项目者优先。
  5. 具备较复杂项目的良好管理能力,有项目负责人或者研发团队接口人经验者优先。
  6. 团队协作能力良好,有实线或者虚线带人完成技术项目者优先。
  7. 熟悉AI框架、云原生、微服务原理和设计模式者优先。

岗位标签

NEW