阿里云智能-数通网络运营专家-杭州
Company Aliyun
Focus Tech · Algorithm
Location 杭州
Published October 10, 2026
岗位职责
我们负责阿里云全球物理网络的变更工程与稳定性管理,以自动化平台承载网络变更的全生命周期——从体系架构设计、方案编排、灰度验证到规模化执行与异常处置、风险管控。随着 AI 大模型与智算集群的爆发式增长,AI 智算网络对变更的确定性、稳定性与自动化水平提出了前所未有的要求。 作为网络运维专家,你将投入到全球网络变更体系的建设与工程化落地:推动自动化体系架构设计与技术演进,制定并落地风控策略,同时把 AI/大模型能力引入自动化平台与风控体系,让运维从"规则驱动"迈向"智能驱动"。这是一个兼具架构深度、工程广度与技术前瞻性的领域岗位,需要在复杂环境中定义方向、拿到结果、沉淀体系。主要职责包括:
- 变更自动化体系建设:主导变更全生命周期的自动化体系架构设计与技术演进,制定变更业务流程与工程方案;负责变更逻辑的编排、落地与维护,以及上线前测试、灰度验证和规模化执行中的异常处置。面向 AI 智算网络等新场景,前瞻设计支撑算力规模化的变更能力。
- 变更风控与监控体系建设:建立并持续演进变更风控与监控告警机制,系统梳理风险、落地管控策略,实现故障的快速发现、通报、定位与闭环;基于审计结果与重复性问题沉淀 SOP,反向优化风控策略与方案。
- AI驱动的智能化演进:将AI/大模型引入变更平台与风控体系,实现方案生成、配置校验、风险识别与根因定位的智能化,替代重复人工判断,提升平台覆盖度与风控预判能力,推动运维从"规则驱动"向"数据与智能驱动"演进。
- 网络工程与运营保障:负责网络架构演进的割接改造与运行态优化,用自动化手段解决软硬件、数据、流程相关的实际问题,提升网络稳定性。
- 数据化运营与知识沉淀:开展变更精细化数据运营,围绕指标、问题与风险建立可度量的运营模型并跟踪改进;维护自动化工具集技术标准、确保合规;推动跨团队标准落地与方案共识,输出技术文档、沉淀最佳实践与知识库。
任职要求
-
5年以上大型数据中心网络、智算/高性能网络或虚拟化网络基础设施的运维管理或测试经验,具备企业级路由器、交换机的实操与问题攻坚能力
-
3年以上 Python 或其他语言开发经验,能够将复杂运维逻辑工程化、平台化,有网络自动化实践者优先
-
对核心网、城域网、数据中心网络、互联网等某一领域的技术趋势与演进有持续跟踪与深入理解
-
理解交换与路由、BGP、MPLS、SRTE、ACL、QoS、负载均衡、DNS等网络和应用协议,理解其在大规模网络中的应用与边界
-
具备较强的业务理解能力,精通复杂的系统与业务级需求与逻辑;具有评估风险并以基于事实的方式进行交流的能力
-
能够将一线运维中发现的问题抽象、沉淀为方法论,并反哺平台能力建设
岗位标签
NEW