SRE运维工程师(Kubernetes / 云原生方向)
Company Mihoyo
Focus Tech · Backend
Location 上海
Published January 7, 2026
岗位职责
- 负责大规模K8S集群的稳定性与生命周期管理,包括集群架构治理、版本升级、组件维护、参数变更、容量规划及日常巡检;
- 负责K8S集群资源治理与成本优化,建设资源使用率、资源浪费、集群容量等可观测体系,持续优化资源配额、节点利用率及弹性扩缩能力;
- 负责K8S集群及节点安全治理,包括 CIS Benchmark、节点及 kubelet 安全基线、NetworkPolicy、访问控制、堡垒机联动及运维审计等;
- 建设集群监控告警、日志、链路追踪及故障自愈体系,负责故障应急 Runbook、SOP 文档编写,主导故障演练;
- 推动容器化、自动化运维及云原生技术在业务中的落地,持续提升平台标准化、自动化和交付效率。
任职要求
- 本科及以上学历,3年以上大规模 K8S 集群运维经验;
- 熟悉至少一种主流公有云/私有云,包括但不限于Aliyun/腾讯云/AWS/GCP;
- 深入理解K8S核心架构及主要组件,熟悉 API Server、Scheduler、Controller Manager、etcd、kubelet、CRI/CNI/CSI 等核心机制,具备容器网络、存储、资源调度及安全治理经验;
- 熟悉 Helm、Kustomize、Terraform、Ansible、GitLab CI/CD、Argo CD 等一种或多种云原生自动化及 IaC 工具;
- 有丰富的生产环境故障排查和性能调优经验,能够快速定位和解决问题;
- 熟悉 Linux 系统管理,包括性能调优、内核参数、systemd、网络栈;
- 熟练使用 Shell,具备 Go 或 Python 等语言的开发能力;
- 具有高度的责任感和主动性,能够与业务方、开发团队紧密合作,推动项目顺利进行.