bilibili-音视频生成算法工程师Company BilibiliFocus Tech · AlgorithmLocation 上海Published August 13, 2026岗位详情 工作职责 负责下一代音视频生成MOE多模态大模型核心算法研发与迭代,聚焦文生音视频、图生音视频、多参考条件生成、视频续画、长视频连贯生成等多模态统一生成算法体系的优化与创新,攻克多任务融合生成的算法难点。 独立牵头核心算法方向全流程研发,自主完成算法问题定义、生成模型架构设计、核心算法方案迭代、训练数据算法闭环构建、量化评测算法体系搭建,针对性优化模型生成效果与算法性能。 联动数据、评测、内容等团队,基于算法实验结果与量化指标,制定模型优化迭代方案,聚焦多模态生成算法能力升级,推动音视频生成算法效果落地与规模化最优迭代。 自主设计系统性算法对照实验,深度复盘实验失败案例、定位算法缺陷与瓶颈,针对性优化模型生成精度、画面连贯性、音画一致性等核心指标,持续迭代升级生成算法能力。 工作要求 任职要求 本科及以上学历,计算机、人工智能、深度学习、多媒体技术等相关专业,具备扎实的深度学习、多模态生成技术功底。 熟练掌握PyTorch框架及分布式训练技术,具备Diffusion model、MOE、VAE、SFT、RLHF、模型蒸馏中至少两项核心技术的落地实践经验。 具备音视频生成相关算法经验,精通多条件参考生成、图像/视频/音频生成与编辑、视频超分、插帧补帧、人物形象一致性、多镜头融合、音画同步等核心技术模块。 具备扎实的算法研究与迭代能力,擅长拆解多模态生成核心算法难题,可独立设计实验方案、分析算法case、提炼优化思路,持续完成模型算法效果迭代升级。 可独立全权负责核心算法方向,覆盖算法问题定义、模型架构与算法方案设计、数据算法闭环、评测算法指标体系搭建、模型训练调优、算法效果验证与迭代全流程。 加分项 具备大规模多模态生成模型完整训练、迭代及工业落地经验。 熟悉CUDA/Triton、DeepSpeed、FSDP、Megatron、Ray、Slurm等高性能训练、推理及集群调度工具。 拥有高质量AI开源项目、顶会论文、音视频生成优质Demo成果。 具备长视频生成、多模态统一大模型、MOE稀疏模型落地实战经验者优先。