Token Foundry-多模态世界模型前沿技术研究-万相Wan

Company Tongyi

Focus Tech · Algorithm

Location 北京, 杭州

Published July 10, 2026

岗位职责

【部门介绍】 随着大模型技术的飞速发展,理解和生成多模态数据(图像、视频、音频、3D素材等)的能力日益增强。目前,构建能够同时进行输入和输出的多模态世界模型已成为业界的研究热点,也是实现通用人工智能(AGI)的重要技术路径之一。 万相Wan将持续在世界模型、原生多模态预训练、理解-生成融合范式、统一Tokenizer研究、人类反馈与强化学习等前沿技术方向上进行探索,始终追求在多模态世界模型领域的领先研究地位,致力于建立世界级的技术影响力。

【工作内容】

  1. 探索大规模多模态理解生成统一基础模型,包括但不限于:统一建模设计、高效模型结构设计、高效Scaling、视觉Tokenizer、多模态联合训练等。
  2. 探索和突破多模态强化学习,包括但不限于:视觉CoT、面向复杂视觉设计任务的强化学习设计、基于用户反馈的在线自学习等。
  3. 构建基于生成模型的真实世界渲染引擎,探索新的多模态交互范式,探索虚拟和真实世界的强化反馈链路设计。

任职要求

  1. 计算机科学、人工智能、机器学习能等领域的博士/硕士毕业生。
  2. 在国际顶级计算机会议/期刊(如NeurIPS、CVPR、ICLR、ECCV、TPAMI等)以一作身份发表过多篇论文,或在开源社区、竞赛中展示出引领性的研究成果。
  3. 具备扎实的代码功底,熟悉PyTorch/TensorFlow等框架,能够高效实现复杂模型结构并进行大规模训练经验;ACM/ICPC,topcoder等编程比赛获奖者优先。
  4. 关注技术影响力,具有开源开放精神,对基础模型的前沿问题有持续热情,有追求,渴望做出有极大影响力的工作。
  5. 具备跨学科视野与协作意识,能够与工程、产品等多学科团队紧密合作,推动研究成果快速落地并产生实际影响。