jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

千问办公-运维研发工程师(DevOps / SRE)-苏杭

Company Dingtalk

Focus Tech · Backend

Location 苏州

Published August 20, 2026

岗位职责

  1. 负责线上生产环境的稳定性保障,包括系统监控、故障应急、容量规划、性能调优与日常运维,持续提升服务可用性(SLA)。
  2. 设计并研发内部运维平台/工具(如自动化部署、监控告警、容量管理、成本优化、故障自愈等),用工程化手段替代重复性人工操作。
  3. 基于阿里云及 Kubernetes 构建和维护云原生基础设施,负责集群的部署、扩缩容、升级与治理。
  4. 建设并持续完善云上与业务两个维度的监控告警和日志收集体系:整合阿里云 SLS、Prometheus、Grafana 等能力,覆盖基础设施、云产品与业务指标,制定合理的告警策略与可观测大盘,实现问题的及时发现与快速定位。
  5. 推进 CI/CD 流水线建设,完善发布、回滚、灰度机制,保障变更安全高效。
  6. 参与线上重大故障的排查与复盘,沉淀应急预案与最佳实践,从根因上减少故障复发。

任职要求

  1. 本科及以上学历,计算机相关专业,3 年以上运维或 SRE 相关工作经验。

  2. 具备一定的开发能力,熟悉至少一门编程语言(如 Go / Python / Java 等),能够独立开发运维平台或自动化工具,而不仅是脚本编写。

  3. 熟悉阿里云核心产品(ECS、SLB、VPC、ACK、RDS、Redis、SLS 等),有较丰富的公有云环境使用与治理经验。

  4. 深入理解 Kubernetes 架构与工作原理,具备生产级 K8S 集群的部署、运维与排障经验。

  5. 拥有较丰富的线上环境运维经验,熟悉高并发、大规模分布式系统的稳定性保障,有独立处理线上故障的实战能力。

  6. 熟悉 Linux 系统与常见中间件,较深入了解阿里云 SLS(日志服务)、阿里云 Prometheus 监控服务及 Grafana,能搭建完善的监控、日志与可观测体系,并有基于其做告警、大盘与运维自动化的实战经验。

  7. 具备扎实的网络基础,理解 TCP/IP、DNS、HTTP、负载均衡、VPC/专线等,能定位跨网络链路的性能与连通性问题。

  8. 具备良好的成本意识,在方案设计与资源使用中主动考虑投入产出,持续推动降本增效。

  9. 对生产环境心存敬畏,严格遵守变更规范,操作谨慎、有风险预判,能对线上安全负责。

  10. 具备较强的自主学习能力,能快速上手新技术、新业务;有良好的责任心与推动力,能够独当一面,独立负责模块或项目的落地。 加分项

  11. 有自研运维平台、自动化运维体系或稳定性平台的从 0 到 1 建设经验。

  12. 熟悉云成本优化(FinOps)、容量规划或资源调度相关实践。

  13. 有音视频、RTC、实时通信等大流量业务的运维经验。

  14. 熟悉 IaC(Terraform / Helm 等)及 GitOps 工作模式。

  15. 有完善监控告警体系的搭建与运营经验,能设计合理的告警策略、降低误报漏报、提升告警有效性。

  16. 有 AIOps / 智能运维相关经验,如利用 AI/大模型做异常检测、根因定位、故障预测、智能问答或运维自动化等。

  17. 具备开源项目贡献或技术社区影响力。