【基座大模型北斗实习】视觉生成与世界模型技术研究
Campus/Intern
Company Meituan
Focus Tech · Algorithm
Location 北京, 上海, 深圳
Published April 3, 2026
岗位职责
简介:参与视觉生成与世界模型方向的前沿研究,可根据个人背景和研究兴趣选择以下方向之一深入推进: 1、高效率、低损失、高压缩比的图像视频 VAE 和 tokenizer 研究。 2、统一生成模型的架构、训练与推理探索(稀疏架构、大尺寸 MoE、自回归生成等)。 3、功能模型研究,包括参考生成、长视频生成、流式实时视频生成、音视频生成等。 4、隐式世界模型、WorldActionModel 及 Action-conditioned WorldModel 的方法研究。 5、世界模型在具身智能、实时交互等场景中的应用探索。 6、其他你坚信路线正确的视觉生成与世界模型前沿方向。
任职要求
1、熟悉扩散模型、VAE等相关研究进展; 2、熟悉PyTorch,有充分的动手实践经验。
加分项: 1、有图像/视频生成、Video-based世界模型相关研究和实习经历,有影响力的开源项目中做出过核心贡献; 2、发表过高水平论文(如ICLR、CVPR、ICCV等),有相关竞赛经历并取得名次。