阿里云智能-云平台高级运维工程师-杭州Company AliyunFocus Tech · BackendLocation 杭州Published August 25, 2026岗位职责 中间件运维与高可用保障:负责消息队列(Kafka/RocketMQ)、服务注册与配置中心(Zookeeper/Nacos)等核心中间件的稳定性维护、性能调优及高可用架构设计;基于Kubernetes完成容器化部署、弹性扩缩容、版本升级及日常运维,保障核心系统7x24小时稳定运行。 故障排查与根因分析:通过日志分析、链路追踪及监控体系快速定位中间件相关故障(如消息堆积、服务注册异常等),主导问题修复与复盘;使用Java或Go开发调试工具,高效排查线上性能瓶颈及与业务系统的兼容性问题。 性能优化与平台适配:测试并优化中间件在不同CPU架构、内核版本及容器环境下的性能表现,解决资源调度与性能瓶颈问题,持续提升中间件运行效率与资源利用率。 负责搭建及使用SRE数字人实现线上运维智能化。 任职要求 技术能力: 中间件:至少精通一项,包括Kafka/RocketMQ集群管理,Zookeeper/Nacos服务发现,Prometheus/Grafana,可靠性保障与性能调优。 编程与排查:至少掌握Java或Go一门语言,能通过代码调试、日志分析等手段排查中间件与业务系统的交互问题;熟悉中间件源码,具备性能测试及代码优化性能的经验;熟练使用Shell/Python编写运维脚本,熟悉Terraform等自动化工具。 容器与云原生:熟悉Kubernetes核心概念(Pod/Service/StatefulSet),具备中间件在K8s环境的部署与运维经验(Helm/Operator优先);了解公有云(阿里云、AWS等)中间件服务或云原生技术栈者优先。 掌握AI基础知识,掌握基础提示词工程,会使用Al专业工具,集成AI到个人工作流;有AI相关开发工具应用研发经验者优先,持有阿里云ACA/ACP/ACE认证证书者优先。 综合能力: 计算机相关专业,3年以上中间件SRE/运维经验。 深入理解SRE理念,能够通过工具化、自动化手段提升系统稳定性与运维效率。 具备快速定位复杂问题的能力,能适应高压力下的故障应急响应。 有强烈技术热情和好奇心,自驱力和学习力强;具备良好的分析与解决问题的能力、沟通以及团队合作能力;喜欢挑战性的技术研发工作,善于攻坚克难,有创新热情,积极乐观,坚韧抗压,结果导向,能够持续推动问题的解决和突破。