GPU运维开发工程师
Company Mihoyo
Focus Tech · Backend
Location 上海
Published January 7, 2026
岗位职责
- 负责Linux服务器集群(生产/开发测试环境)的全生命周期管理,包括部署实施、性能调优、故障诊断及容灾方案设计;
- 负责数据中心硬件资源的规划与运维,涵盖主流厂商x86架构服务器、GPU计算节点的上架部署、压力测试、健康监控及故障处置;
- 管理混合云基础设施,包括OpenStack私有云及AWS/Aliyun等公有云IaaS资源,确保云环境高可用性及安全合规;
- 参与自动化运维体系建设,基于Ansible/SaltStack构建CI/CD流水线,开发运维效率工具链,推动DevOps实践落地;
- 参与系统架构优化设计,开展虚拟化(KVM/Docker)及容器编排(K8s)技术的落地实施与日常维护。
任职要求
- 本科及以上学历,计算机相关专业,具有2年以上中大型互联网基础设施运维经验;
- 精通CentOS/Ubuntu等Linux发行版管理,深入理解操作系统原理及内核调优策略;
- 熟悉x86服务器架构及GPU异构计算平台,具备硬件级故障诊断能力;
- 掌握TCP/IP协议栈及主流网络服务(Nginx/HAProxy/Keepalived)的部署调优;
- 熟练使用Shell/Python开发运维脚本,具备Ansible/SaltStack等自动化工具二次开发能力 具备完整的PXE/Kickstart装机系统建设经验,熟悉Zabbix/Prometheus监控体系搭建;
- 熟悉虚拟化技术栈(KVM/VMware)及容器化生态(Docker/K8s),有云平台Terraform实践者优先。