bilibili-音视频理解算法工程师Company BilibiliFocus Tech · AlgorithmLocation 上海Published August 13, 2026岗位职责 岗位详情 工作职责 Omni VLM 基础模型研发 负责面向视频理解的 Omni VLM / 多模态理解基础模型研发。 参与模型架构、数据体系、训练方法和评测体系建设。 开展大规模图像、视频、音频和文本数据上的 VLM 预训练。 开展多模态 SFT、偏好对齐、强化学习、复杂推理等后训练工作。 提升模型在长视频理解、时序推理、细粒度感知和多模态交互等方面的能力。 Captioner 建设高质量视频 Caption 和结构化语义理解能力。 提升模型对人物、场景、动作、事件、镜头、风格、音频和叙事等信息的理解。 为视频生成基模提供高质量训练数据和语义条件。 Prompt Enhance(PE) 研发面向视频生成的 Prompt Enhance 模型与策略。 将用户简短或模糊的意图转化为准确、丰富且适合视频生成的提示词。 提升生成结果的语义一致性、视觉表现和可控性。 Reward Model 与评估 建设面向视频生成的 Reward Model 和自动化评测体系。 评估文本—视频对齐、画面质量、运动质量、时序一致性、物理合理性和审美表现。 为视频生成基模的训练、偏好对齐和效果优化提供反馈信号。 Agent 创作链路 研发基于 Omni VLM 的视频创作 Agent。 建设意图理解、任务规划、Prompt Enhance、素材理解、工具调用和结果评估等能力。 探索视频的多轮生成、局部修改和自动迭代优化。 工作要求 计算机、人工智能、自动化、数学或相关专业硕士及以上学历。 具备扎实的机器学习、深度学习和 Transformer 基础,熟练使用 PyTorch 等主流框架。 熟悉多模态基础模型,对视觉编码、跨模态对齐、时序建模和语言建模有深入理解。 具有以下至少一个方向的研发经验: Omni Model、VLM 或多模态理解基础模型; VLM / LLM 预训练或后训练; 视频理解、视频 Caption 或视频推理; Reward Model、偏好对齐或强化学习; 视频生成或图像生成基础模型; 多模态 Agent、工具调用或任务规划。 熟悉基础模型的数据构建、分布式训练、推理优化和模型评估流程。 具备良好的工程能力、自驱力和协作能力,能够独立推进算法研发与实验迭代。 加分项 参与过大规模 VLM / LLM 的预训练或后训练。 具有多模态 SFT、RLHF、DPO、GRPO、RLAIF 或 Reward Model 经验。 具有视频生成、Diffusion 或 Flow Matching 相关经验。 具有长视频理解、音视频联合建模或多模态推理经验。 具有视频创作 Agent、多轮生成或工具调用系统经验。 在相关顶级会议或期刊发表过论文,或有高质量开源项目。