SRE运维工程师(Kubernetes / 云原生方向)

Company Mihoyo

Focus Tech · Backend

Location 上海

Published January 7, 2026

岗位职责

  1. 负责大规模K8S集群的稳定性与生命周期管理,包括集群架构治理、版本升级、组件维护、参数变更、容量规划及日常巡检;
  2. 负责K8S集群资源治理与成本优化,建设资源使用率、资源浪费、集群容量等可观测体系,持续优化资源配额、节点利用率及弹性扩缩能力;
  3. 负责K8S集群及节点安全治理,包括 CIS Benchmark、节点及 kubelet 安全基线、NetworkPolicy、访问控制、堡垒机联动及运维审计等;
  4. 建设集群监控告警、日志、链路追踪及故障自愈体系,负责故障应急 Runbook、SOP 文档编写,主导故障演练;
  5. 推动容器化、自动化运维及云原生技术在业务中的落地,持续提升平台标准化、自动化和交付效率。

任职要求

  1. 本科及以上学历,3年以上大规模 K8S 集群运维经验;
  2. 熟悉至少一种主流公有云/私有云,包括但不限于Aliyun/腾讯云/AWS/GCP;
  3. 深入理解K8S核心架构及主要组件,熟悉 API Server、Scheduler、Controller Manager、etcd、kubelet、CRI/CNI/CSI 等核心机制,具备容器网络、存储、资源调度及安全治理经验;
  4. 熟悉 Helm、Kustomize、Terraform、Ansible、GitLab CI/CD、Argo CD 等一种或多种云原生自动化及 IaC 工具;
  5. 有丰富的生产环境故障排查和性能调优经验,能够快速定位和解决问题;
  6. 熟悉 Linux 系统管理,包括性能调优、内核参数、systemd、网络栈;
  7. 熟练使用 Shell,具备 Go 或 Python 等语言的开发能力;
  8. 具有高度的责任感和主动性,能够与业务方、开发团队紧密合作,推动项目顺利进行.