GPU运维开发工程师

Company Mihoyo

Focus Tech · Backend

Location 上海

Published January 7, 2026

岗位职责

  1. 负责Linux服务器集群(生产/开发测试环境)的全生命周期管理,包括部署实施、性能调优、故障诊断及容灾方案设计;
  2. 负责数据中心硬件资源的规划与运维,涵盖主流厂商x86架构服务器、GPU计算节点的上架部署、压力测试、健康监控及故障处置;
  3. 管理混合云基础设施,包括OpenStack私有云及AWS/Aliyun等公有云IaaS资源,确保云环境高可用性及安全合规;
  4. 参与自动化运维体系建设,基于Ansible/SaltStack构建CI/CD流水线,开发运维效率工具链,推动DevOps实践落地;
  5. 参与系统架构优化设计,开展虚拟化(KVM/Docker)及容器编排(K8s)技术的落地实施与日常维护。

任职要求

  1. 本科及以上学历,计算机相关专业,具有2年以上中大型互联网基础设施运维经验;
  2. 精通CentOS/Ubuntu等Linux发行版管理,深入理解操作系统原理及内核调优策略;
  3. 熟悉x86服务器架构及GPU异构计算平台,具备硬件级故障诊断能力;
  4. 掌握TCP/IP协议栈及主流网络服务(Nginx/HAProxy/Keepalived)的部署调优;
  5. 熟练使用Shell/Python开发运维脚本,具备Ansible/SaltStack等自动化工具二次开发能力 具备完整的PXE/Kickstart装机系统建设经验,熟悉Zabbix/Prometheus监控体系搭建;
  6. 熟悉虚拟化技术栈(KVM/VMware)及容器化生态(Docker/K8s),有云平台Terraform实践者优先。