多模态理解算法工程师-【可灵AI】
Company Kuaishou
Focus Tech · Algorithm
Location 北京
Published May 12, 2026
岗位职责
1、承担视频Caption和参考生成的Instruction职责,特别是在多分镜、高动态、长视频等场景提供精准、全面的描述,最大化弥合文本模态和视频模态之间的差异; 2、承担Agentic PE的职责,对用户指令进行精准、有效、丰富的改写,从15秒片段效果和分钟级成片两个角度实现最佳的PE,控制视频生成模型产出最符合用户需求的视频内容; 3、承担Reward model的职责,能够客观、稳定地评价模型画面、运动、合理性等方面的表现,辅助视频模型训练监控、模型版本选择; 4、承担理解基模后训练的职责,充分利用可灵数据训练最适合团队的多模态理解基座模型,支撑可灵全链路的数据算法、理解算法任务。
任职要求
1、有音视频理解、多模态Caption、理解生成一体化、理解/生成Benchmark等方向的经验,有大厂实习、顶会论文优先; 2、有自主开发能力且能用好Agent进行日常工作辅助开发,有多模态理解模型训练经验优先; 3、重视多模态理解能力在实际工业场景的价值,痴迷业务价值而不是绝对榜单分数; 4、有理解、生成模型能力水位的客观判断能力,有实际动手验证的能力,对自身能力保持清晰认知; 5、有良好的协作与沟通能力,能积极与团队进行沟通,能准确、清晰表达自己的需求。