基础设施与稳定性工程-中间件运维工程师/专家-杭州
Company 阿里巴巴
Focus 技术 · 后端
杭州
July 30, 2026
岗位职责
【团队介绍】 阿里巴巴中间件团队是集团基础技术的核心支撑力量,负责消息、服务发现与软负载、分布式协调、任务调度)、配置管理等核心中间件产品在集团内部的稳定性保障与运维体系建设。 这些中间件承载了阿里集团几乎所有在线业务的流量调度、服务通信与数据流转,覆盖电商、物流、本地生活、云计算、大文娱等 BU,日均处理万亿级消息、百万级服务节点调度,是每年双 11 大促的底层生命线。
团队当前重点方向: 1、稳定性工程 — 从准入规范、变更管控到容灾演练的全链路保障体系,目标全年中间件可用性 99.99%; 2、AI 智能运维(Agentic SRE) — 将运维经验沉淀为 Agent Skills,通过 LLM + MCP 实现告警自愈、风险治理、架构演进,通过 AI 提升中间件产品的稳定性
我们相信:下一代 SRE 不只是运维工程师,更是用 AI 重新定义运维的人。 如果你既有系统功底,又对用技术杠杆 10x 提效充满热情,这里是你的主场。
【职责描述】
- 负责阿里巴巴集团核心中间件(软负载 / 消息 / ZooKeeper / 配置中心等)的稳定性保障,包括故障定位、性能调优、容量规划与成本治理;
- 主导中间件重大风险识别、应急预案设计与容灾演练,确保分钟级恢复能力;
- 建设中间件 + AI 智能运维体系(Agent / Skills / MCP),实现 10x 效率提升,将人工经验沉淀为可复用的自动化能力;
- 面向业务需求提供中间件选型建议与架构方案,联动产品和开发推动落地;
- 参与大规模集群建站、大促备容及架构升级,支撑集团业务持续增长。
任职要求
- 对运维体系、运维理念以及大规模高性能网站架构有深入理解和实践经验;
- 熟悉 Java / Go / Python 至少一门语言,能读能写能排查;
- 计算、存储、网络基本功扎实,精通 Linux 系统管理与性能调优;
- 熟悉分布式系统原理(一致性、高可用、高并发),有中间件或基础设施运维经验优先;
- 熟悉 Docker + Kubernetes,具备容器化环境下的运维实战能力;
- 熟悉 AI Agent 架构,认同和理解 AI Native工作方式,在 LLM 应用有真实落地经验(LangChain / Agent / MCP / Skills 中至少一项);
- 加分项:参与过开源中间件项目(RocketMQ / Dubbo / Nacos / ZooKeeper / Envoy 等),或有大规模集群运维经验;
- 主动、乐观、皮实、心细,能扛得住大规模系统的不确定性。 9.英文听说读写流利,能够和海外团队对接
岗位标签
NEW