AIGC / 多模态算法实习生(J105472)
Intern
Company Baidu
Focus Tech · Algorithm
Location 北京
Published September 23, 2026
岗位职责
- 参与爆款视频的智能分析与 AIGC 复刻,完成视频内容理解、镜头拆解、视觉元素提取及生成方案设计
- 基于多模态大模型分析视频中的人物、场景、动作、镜头语言、叙事结构和视觉风格,并构建结构化的视频内容描述
- 参与图像/视频生成模型的 Prompt、Reference、Control 等生成策略设计,提升生成内容与原视频在主体、场景、构图及风格上的一致性
- 针对生成视频中的画面质量、人物一致性、运动合理性、时序稳定性、镜头衔接等问题进行分析和算法优化。
- 跟踪视频生成、图像生成、多模态大模型等前沿技术,参与论文调研、代码复现和算法方案落地
任职要求
- 计算机、人工智能、电子信息、数学等相关专业硕士或博士在读
- 掌握计算机视觉和深度学习基础,熟悉 Transformer、Diffusion 等相关技术
- 熟悉 Python,掌握 PyTorch 等至少一种深度学习框架,具备良好的代码实现和实验分析能力
- 对视频生成、图像生成、视频理解、多模态大模型等方向有较强兴趣,有相关项目、科研或竞赛经验者优先
- 了解主流视频/图像生成模型及多模态大模型,具备一定的论文阅读、技术调研和代码复现能力
- 具备较强的问题分析和解决能力,能够主动发现问题并推动算法方案落地