诚云科技-服务器硬件运维保障工程师-CTO
Company Aliyun
Focus Tech · Backend
Location 杭州
Published September 29, 2026
岗位职责
- 带外可用性保障与远程管控:负责百万级物理服务器带外(OOB)系统的可用性监控与维护,建设并优化带外链路监控、巡检、告警及 SLA 运营机制,保障远程带外管控通道稳定可靠,确保带外检测、远程控制等核心能力持续在线,推动带外可用性SLA的达成与持续提升。
- 电力变更安全管理:参与服务器电力变更(上下电、电力切换、电源冗余验证等)的方案设计、风险评估与安全执行,制定电力变更操作流程规范,确保变更过程零事故,保障业务连续性。
- 高危风险识别与治理:系统性识别运维过程中的高危风险(硬件亚健康、固件缺陷、配置漂移、安全合规漏洞等),建立风险评估模型和治理机制,推动风险从发现到闭环的全流程管理,持续降低线上隐患存量。
- 线上故障应急与恢复:参与7x24小时故障应急响应机制的设计与实施,承担线上服务器故障的快速定位、应急处置与业务恢复,推动故障根因分析(RCA),制定预防措施以降低重复故障率,保障故障MTTR达标。
- 自动化与标准化建设:参与和落地自动化运维方案,优化运维流程标准化程度,推动运维工具与平台建设,结合AI Native、数据化运维等前沿技术方向,提升运维效率和智能化水平。
任职要求
- 计算机科学、电子工程、通信工程等相关专业,三年及以上SRE或服务器运维相关经验,具备扎实的计算机底层硬件基础知识,熟悉CPU、内存、存储、RAID、网卡等核心硬件组件的工作原理。
- 熟练掌握Linux/UNIX操作系统,具备Shell、Python、SQL等脚本编程能力,能独立完成自动化运维工具开发与日常运维提效。
- 熟悉服务器硬件故障定位与修复流程,具备硬件性能瓶颈分析及优化能力,能独立承担故障诊断与处置工作。
- 具备良好的沟通表达能力和团队协作精神,较强的服务意识和抗压能力,能够适应值班与应急场景。
- 有IDC数据中心服务器运维或厂商售后工程师经验,具备大规模物理服务器集群运维的实战能力优先。
- 有 GPU、液冷服务器、异构服务器等新型基础设施运维经验优先。
岗位标签
NEW