高性能网络工程师
Company Mihoyo
Focus Tech · Backend
Location 上海
Published January 7, 2026
岗位职责
- AI 训练网络极致调优:熟悉大模型分布式训练的通信模式;全面负责基于 RoCEv2 或 InfiniBand (IB) 协议栈的端到端网络性能调优,最大化提升 GPU 集群的有效通信带宽与训练时的网络吞吐量。
- 拥塞控制与无损网络管理:负责交换机与智能网卡的拥塞控制算法(如 DCQCN)调优。精细化配置 PFC、ECN 等ROCE配置,减少网络突发导致的丢包与长尾延迟。
- 复杂训练故障深度排障: 快速定位并解决 AI 训练中遇到的疑难杂症。包括但不限于:NCCL 集合通信超时、训练性能突然下降、网卡/PCIe 降速、PFC 风暴与死锁等。
任职要求
- 学历与经验: 计算机科学、通信工程或相关专业本科及以上学历;具备 3 年以上超大规模AI数据中心网络运维经验,必须具备 1 年以上独立负责 AI 算力集群/HPC 高性能网络调优实战经验。
- 协议理解: 精通 RDMA 技术原理,深入理解 RoCEv2 数据包封装结构及 InfiniBand 架构体系;对数据中心无损网络的流控机制有深刻理解。
- 算力硬件生态熟练度: 熟练配置和调试基于TH
- TH5,或 NVIDIA Spectrum芯片的白盒/黑盒交换机;精通ConnectX-6/7/8系列网卡的性能差异。
- 精通底层排障工具链: 熟练使用相关Linux 网络软件及 RDMA 诊断工具。
- 编程与自动化能力: 熟练掌握 Python 或 Golang,能够独立编写分析网络性能日志和交换机日志的对比分析工具及各种阀值的调优参数。