jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

多模态理解算法研究员

Intern

Company Kuaishou

Focus Tech · Algorithm

Location 深圳, 北京

Published August 12, 2026

岗位职责

  1. 承担视频Caption和参考生成的Instruction职责,特别是在多分镜、高动态、长视频等场景提供精准、全面的描述,最大化弥合文本模态和视频模态之间的差异;
  2. 承担Agentic PE的职责,对用户指令进行精准、有效、丰富的改写,从15秒片段效果和分钟级成片两个角度实现最佳的PE,控制视频生成模型产出最符合用户需求的视频内容;
  3. 承担Reward model的职责,能够客观、稳定地评价模型画面、运动、合理性等方面的表现,辅助视频模型训练监控、模型版本选择;
  4. 承担理解基模后训练的职责,充分利用可灵数据训练最适合团队的多模态理解基座模型,支撑可灵全链路的数据算法、理解算法任务。

任职要求

  1. 有音视频理解、多模态Caption、理解生成一体化、理解/生成Benchmark等方向的经验,有大厂实习、顶会论文优先;
  2. 有自主开发能力且能用好Agent进行日常工作辅助开发,有多模态理解模型训练经验优先;
  3. 重视多模态理解能力在实际工业场景的价值,痴迷业务价值而不是绝对榜单分数;
  4. 有理解、生成模型能力水位的客观判断能力,有实际动手验证的能力,对自身能力保持清晰认知;
  5. 有良好的协作与沟通能力,能积极与团队进行沟通,能准确、清晰表达自己的需求。