AI集群运维(大模型)

Company Mihoyo

Focus Tech · Algorithm

Location 上海

Published January 7, 2026

岗位职责

  1. 多地域AI集群的 K8s 平台搭建、调优(apiserver / etcd / scheduler / kubelet等核心组件)、版本升级、参数变更与日常巡检

  2. 自研训推平台系统的部署、发布与变更

  3. 集群节点上下线流程管理、与硬件运维协同处理故障节点

  4. 集群故障定位与恢复:包括控制面降级、apiserver 性能异常、etcd OOM、节点批量 NotReady、慢节点、网络异常等典型场景

  5. 集群与服务器安全加固(CIS 基线、kubelet 参数、network policy 落地)、堡垒机联动、运维审计

  6. 故障应急 Runbook 与 SOP 文档编写,主导或参与故障复盘

任职要求

  • 计算机科学与技术、软件工程、信息系统等计算机相关专业,本科及以上学历
  • 4 年以上大规模 K8s 集群运维经验
  • 精通 K8s 核心组件(apiserver / etcd / kubelet / scheduler / controller-manager)原理与调优方法
  • 熟悉容器运行时(containerd / runc)与 Linux cgroup 机制
  • 熟悉 K8s 网络方案:主流 CNI 实现(Calico / Cilium / Flannel 等)、kube-proxy、Service / Ingress / NetworkPolicy、DNS、Cilium 等核心组件原理
  • 具备 K8s 集群网络排障能力:能够使用 tcpdump、conntrack、iptables、ip netns、ss、ethtool 等工具进行网络问题定位与抓包分析,能定位跨节点网络异常、Pod 网络不通、Service 转发异常等典型问题
  • 熟悉至少一种 GPU 调度方案(Volcano / Kueue / KAI )
  • 熟悉 Linux 系统管理,包括性能调优、内核参数、systemd、网络栈
  • 具备 Shell 脚本能力,掌握 Python 或 Go 中至少一种,可独立开发运维工具
  • 接受 7×24 二线 oncall 值班安排