资深算力服务器稳定性专家
Company 哔哩哔哩
Focus 技术 · 后端
上海
July 7, 2026
岗位详情
工作职责: 岗位职责:
- 负责AI算力集群运维体系建设,保障算力集群持续稳定运行。
- 负责AI算力集群可观测性建设,建立各类故障知识库,提高故障发现覆盖率与准确率
- 参与AI算力集群建设交付,制定并优化算力交付基线、交付压测与检查,保障交付资源稳定性与性能一致性。
- 构建自动化运维工具链,提升集群故障自愈率与运维效率,有效降低故障影响。 工作要求: 任职要求:
- 计算机、电子工程或相关专业本科及以上学历,熟悉PCIe、NVLink、CXL等高速互联协议,了解GPU服务器架,具备6年以上服务器硬件研发经验;
- 熟悉主流AI服务器的硬件及系统、RDMA网络等相关基础设施,有千卡及以上规模AI算力集群建设、运维经验优先;有互联网大厂或服务器ODM/OEM厂商工作经验者优先;
- 对AI集群运维有较好的认知和全局意识,具备有较强的分析、解决问题的能力;
- 具备优秀的故障定位与根因分析能力,能独立驱动跨团队协作解决复杂硬件问题;
- 良好的沟通协作能力,有良好的团队合作精神;对工作充满热情,责任心强、有一定的抗压能力;
- 能够熟练运用脚本语言(Python/Shell等)完成日常任务或自动化工具开发