bilibili-多模态训练优化工程师Company BilibiliFocus Tech · AlgorithmLocation 上海Published August 13, 2026岗位职责 岗位详情 工作职责 负责大规模GPU集群的管理与训练系统建设,包括任务调度、资源管理、训练框架适配与性能优化。 解决超大规模训练任务中出现的稳定性、网络通讯、NCCL通讯、断点恢复等问题,构建训练全链路可观测体系。 针对不同GPU型号,进行算子适配和算子调优,实现慢节点自动检测与故障自愈。 针对不同训练场景、集群环境,设计自动化运维工具,持续优化训练方案与GPU有效利用率。 与算法、数据、平台紧密配合,打造一套高效的训练生态,推动训练成本优化。 工作要求 工作要求 精通C++、Rust、Python等任意一门语言,C++更佳,具备良好的系统设计与工程实现能力。 熟悉Megatron、DeepSpeed、PyTorch、FSDP等一种或者多种训练框架的底层原理。 有真实GPU训练任务调优经验,解决过训练中出现过的慢节点、机器故障、网络拥塞等问题。 在大规模训练任务中,有过算子调优、精度验证、CUDA优化、训练策略优化(ZeRO/TP/PP/DP/EP)等经验。 有RDMA网络、高性能存储、NCCL通讯等方面的经验,熟悉Linux系统编程。 加分项 社区开源训推框架贡献者,包括但不限于Megatron、DeepSpeed、SGLang、vLLM等; 有大规模音视频生成与理解模型的训练/推理优化经验,如视频生成、多模态理解等方向; 有大规模MoE(Mixture of Experts)与Diffusion Transformer(DiT)模型的训练性能优化、显存优化、通信优化等实战经验; 有千卡/万卡GPU任务训推经验, 有H卡、B卡针对性调优经验