阿里云智能-网络运维专家-北京/杭州

Company Aliyun

Focus Tech · Backend

Location 北京, 杭州

Published October 9, 2026

岗位职责

负责建设边缘云的持续运维能力;

  • 事前:建立并持续优化系统运维的预警机制,进行稳定性风险的分析与管控,前置梳理风险漏洞,降低风险/故障的发生率;
  • 事中:建立并持续优化系统运维的监控机制,快速发现、通报、定位及处理疑难故障;
  • 事后:针对疑难故障,能够快速分析、诊断、定位问题,协同开发人员解决问题;建立健全快速恢复服务机制,降低业务受损程度,确保产品、业务稳定运行;牵头问题复盘工作,通过架构优化等根治引起不可用的问题。
  1. 智能化/自动化运营能力建设
  • 负责智能化/自动化的运维场工具能力落地开发,编写自动化运维脚本,帮助解决生产系统遇到的容量、性能、稳定性等问题,推进网络自动化运维能力建设;
  • 负责精细化数据运营,通过对日常运维指标、问题、风险进行分析和研究,建立模型、计算ROI/TCO解决问题,跟踪改进优化措施落地,保证可持续运营;
  • 负责高可用保障体系建设,如故障自动定位、自动恢复、自适应容灾、云原生技术实施及落地等,保障业务持续可用。
  1. 负责维护海内外的边缘云基础设施网络;
  • 全球全球骨干网、城域网、数据中心网络、光网络巡检维护以及故障定位和恢复;
  • 全球互联网稳定性和质量运营,负责互联网终端用户、云厂商到阿里云互联互通质量相关的售前、售后的技术服务支持和以及质量优化所需改造优化工作;
  • 全球网络运营风险管理,负责网络生命周期的风险识别、规避控制和消除,涉及架构引入测试、验收、风险防范,确保网络服务满足稳定性需求。
  • 互联链路质量运营,负责网络设备光模块/AOC/DAC线缆的产品引入、质量控制、线上运营、链路故障维修支持和能力建设。
  1. 运营架构落地&质量优化体系建设
  • 网络运维高可用标准制定、研发测试、准入测试,包括新架构引入、架构HLD、LLD讨论、运营标准制定、研发测试、准入测试;
  • 制定与优化本领域内的相关新产品\新功能的的SLA协议承诺,并基于SLA要求,评审新产品\新功能的架构是否可用、安全;
  • 积累网络运维最佳实践,输出运维技术文档、知识库建设等。
  1. 基础网络运营生命周期优化保障
  • 全球网络资源建设、标准化服务开通,自动化交付能力建设&优化&提效,确保高质量网络资源交付履约;保证业务增长需求;
  • 全球网络变更方案全生命周期自动化体系架构设计、技术演进改造变更实施相关业务流程、风控策略制定并落地,优化工程方案制定及自动化能力开发,完成变更方案业务逻辑在自动化体系中的编排、落地、维护,并负责变更场景常态化运营前的测试、灰度,以及变更执行和过程中的异常处理;
  • 全球网络裁撤体系流程设计、方案制定,自动化落地;对接、协调其它专业团队完成网络裁撤前的准备,并负责裁撤变更执行的跟踪,处理变更执行过程中的异常,保证网络资源安全高效下线。

加分项

  1. 有传输系统维护经验,熟悉常见的传输组网模式、备份模式;能够对传输常见问题熟练应对;
  2. 熟悉CDN系统,对常见的CDN调度模式熟练掌握、掌握HTTP基本知识;
  3. 熟练的英语能力,能够用英语同运营商进行故障申报、问题讨论、方案沟通。

任职要求

基本要求:

  • 5年以上大型数据中心网络或虚拟化网络设计、建设和运维经验
  • 1年及以上的运维自动化系统开发、网络架构设计经验
  • 研发项目管理经验
  • 对本领域(核心网、城域网、光网络、数据中心网络、互联网)的技术趋势和演进有持续的跟踪与了解
  • 基本掌握网络架构设计、性能优化、稳定性优化等领域的专业能力
  • 具备一定的业务线影响力和公信力,能够影响和协同跨团队的资源
  • 精通系统级需求,对所负责运维的产品/系统有较深刻的理解,持续发现并分析当下问题,提出解决方案并推动落地拿到结果(独立应对XX%及以上的疑难故障问题)
  • 具备复杂项目管理能力,能够从技术、运营、风险、ROI等多方面进行分析,并提出切实解决方案
  • 单产品研发安全生产执行者
  • 能够在单产品/中型复杂系统层面推动建立完善的研发安全生产体系,并推动落地,保障相关产品/技术/系统的可容灾、可观测、可处置、可运维、可快恢
  • 熟练掌握业内主流的研发安全生产技术体系
  • 具有产品级、中型复杂系统的研发安全生产经验,能够应对比较复杂的项目环境和各类突发状况,保障研发项目的平稳落地
  • 具备参与研发安全演练的技术能力,是容灾演练、红蓝对抗、突袭演练等场景下的一线主力
  • 具备智能化/自动化运维的理念,能够独立负责自动化运维的开发工作
  • 具备业务、技术及运营的全局视角,对日常运维指标、问题、风险进行分析和研究,通过建立模型、预测风险来解决、优化和落地 ‒ AI应用能力
  1. 熟练掌握至少一门编程语言(Python / Java / C 等),能够独立完成从需求分析到代码交付的完整开发流程,有实际项目落地经验

  2. 对 AI 技术在运维领域的应用保持敏锐的探索意识,能主动跟踪行业前沿实践,持续挖掘 AI 赋能运维提效的新场景与新可能 ‒ 目标驱动以结果为导向,面对复杂或模糊的目标时,能够自主拆解为可执行的阶段性计划,并持续推进直至达成 ‒ 具备跨团队协作能力,能与不同职能角色高效对齐需求、同步进展,在目标出现分歧时推动各方找到可落地的解决方案

岗位标签

NEW