AIGC / 多模态算法实习生(J105472)

Intern

Company Baidu

Focus Tech · Algorithm

Location 北京

Published September 23, 2026

岗位职责

  • 参与爆款视频的智能分析与 AIGC 复刻,完成视频内容理解、镜头拆解、视觉元素提取及生成方案设计
  • 基于多模态大模型分析视频中的人物、场景、动作、镜头语言、叙事结构和视觉风格,并构建结构化的视频内容描述
  • 参与图像/视频生成模型的 Prompt、Reference、Control 等生成策略设计,提升生成内容与原视频在主体、场景、构图及风格上的一致性
  • 针对生成视频中的画面质量、人物一致性、运动合理性、时序稳定性、镜头衔接等问题进行分析和算法优化。
  • 跟踪视频生成、图像生成、多模态大模型等前沿技术,参与论文调研、代码复现和算法方案落地

任职要求

  • 计算机、人工智能、电子信息、数学等相关专业硕士或博士在读
  • 掌握计算机视觉和深度学习基础,熟悉 Transformer、Diffusion 等相关技术
  • 熟悉 Python,掌握 PyTorch 等至少一种深度学习框架,具备良好的代码实现和实验分析能力
  • 对视频生成、图像生成、视频理解、多模态大模型等方向有较强兴趣,有相关项目、科研或竞赛经验者优先
  • 了解主流视频/图像生成模型及多模态大模型,具备一定的论文阅读、技术调研和代码复现能力
  • 具备较强的问题分析和解决能力,能够主动发现问题并推动算法方案落地