蚂蚁集团-服务器系统专家-杭州
Company Antgroup
Focus Tech · Backend
Location 杭州
Published September 2, 2026
岗位职责
- 负责统筹大规模智算服务器的部署方案论证、到货上架验收、物理布线核验与基础交付工作,监督施工规范与安全,保障交付效率。
- 主导服务器系统初始化(BIOS/BMC/固件/驱动等基线配置),排查交付过程中的技术异常,协调厂商完成兼容性调试与故障处置,保障交付配置 100% 符合标准。
- 负责新机型与批量交付服务器的系统级压力测试与入池验收(GPU Burn、NCCL 带宽测试、Memtester、FIO 存储压测等),前置拦截硬件缺陷。
- 负责生产集群中硬件疑难故障(GPU 掉卡/Xid、PCIe AER、内存 ECC、光模块抖动等)的深度定位、现场维修复核及厂商 RMA 报修闭环,降低返修率并压缩 MTTR。
- 负责硬件运行稳定性治理,从日常运维中洞察硬件批次性隐患,推动厂商完成失效分析(FA)并闭环质量改进。
任职要求
- 本科及以上学历,计算机、通信、电子、自动化等相关专业,3 年以上服务器硬件工程、系统测试、IDC 交付验收或硬件运维诊断实战经验。
- 了解机柜供电系统(如冗余供电、功率分配),熟悉网络基础架构,有大规模智算服务器管理经验。
- 深入理解 x86/ARM 服务器体系结构,熟悉主流GPU/xPU智算服务器的硬件架构与运维规范。
- 熟练掌握通过 BMC Web、IPMItool、Redfish 或厂商管理工具进行带外配置批量下发、日志导出、传感器监控与固件升级。
- 精通 Linux 系统排障与硬件日志分析(BMC SEL、OS dmesg、MCE、PCIe AER、nvidia-bug-report 等),具备快速精准判定硬件物理故障的能力。
- 熟练掌握 Python 或 Shell 至少一种脚本语言,具备自动化脚本编写经验;有互联网服务器管理或OEM/ODM 厂商 FAE/TSE 经验者优先。
岗位标签
NEW
特色标签
AI服务器、Ansible、CentOS、Docker、Firmware、GPU压力测试、GPU服务器、IDC机房运维、Kubernetes、NVIDIA集体通信库测试、PCI Express错误日志、PCIe高级错误报告、Prometheus、Python、Redfish带外管理协议、RedHat、Shell、Ubuntu、Zabbix、不限、云原生、云计算、保险、信贷、内存纠错、内核环缓冲区日志、基本输入输出系统、基板管理控制器、基础设施、平均修复时间、技术支持工程师、支付、故障平均恢复时间、智能平台管理接口工具、机器检查异常、熟悉Linux/Unix系统、现场应用工程师、理财、系统事件日志、系统运维、计算机相关专业、质保退货、运维开发经验、返厂维修、退货授权、通信/工程相关专业、金融、错误校验内存、风控、高性能计算服务器