【基座大模型北斗实习】视觉生成与世界模型技术研究

Intern

Company Meituan

Focus Tech · Algorithm

Location 北京, 上海, 深圳

Published April 3, 2026

岗位职责

简介:参与视觉生成与世界模型方向的前沿研究,可根据个人背景和研究兴趣选择以下方向之一深入推进:

  1. 高效率、低损失、高压缩比的图像视频 VAE 和 tokenizer 研究。
  2. 统一生成模型的架构、训练与推理探索(稀疏架构、大尺寸 MoE、自回归生成等)。
  3. 功能模型研究,包括参考生成、长视频生成、流式实时视频生成、音视频生成等。
  4. 隐式世界模型、WorldActionModel 及 Action-conditioned WorldModel 的方法研究。
  5. 世界模型在具身智能、实时交互等场景中的应用探索。
  6. 其他你坚信路线正确的视觉生成与世界模型前沿方向。

任职要求

  1. 熟悉扩散模型、VAE等相关研究进展;
  2. 熟悉PyTorch,有充分的动手实践经验。

加分项:

  1. 有图像/视频生成、Video-based世界模型相关研究和实习经历,有影响力的开源项目中做出过核心贡献;
  2. 发表过高水平论文(如ICLR、CVPR、ICCV等),有相关竞赛经历并取得名次。