蚂蚁集团-世界模型算法工程师 / 研究员-交互式视频生成方向
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published September 29, 2026
岗位职责
我们正在探索可交互的生成式世界:由代码和游戏引擎维护场景状态,通过实时渲染的视觉条件引导视频模型,让用户能够连续 控制角色、车辆和视角,并在长时间交互中保持场景、物体身份与运动的一致性。
这个岗位会参与从数据构建、模型训练到交互系统落地的完整过程。我们关注生成画面的质量,也关注模型能否准确响应操作、 处理遮挡与接触,并持续稳定地生成。
你将负责:
- 研发动作与视觉条件驱动的视频世界模型,提升控制精度、画面质量、空间一致性和物理合理性。
- 探索因果视频生成、流式解码、历史缓存与长期记忆,解决长程生成中的内容漂移、身份变化和误差累积。
- 研究条件编码与融合方法,将场景布局、深度、对象身份、相机和动作信息有效注入模型,保证训练与推理使用一致的数据定义。
- 建设训练数据管线,结合程序化场景、游戏引擎与视频重建,构造可控、可重放、覆盖不同时长和交互行为的数据。
- 开展模型微调、少步蒸馏与推理优化,降低交互延迟;建立短片和长程交互评测,通过实验定位问题并推动改进。
任职要求
我们希望你具备:
- 扎实的机器学习基础,熟练使用 Python、PyTorch,能够独立完成训练、调试、评估与问题分析。
- 在视频生成、扩散模型、生成式世界模型或相关方向有深入项目经验,理解模型结构、训练目标与采样过程。
- 具备大模型训练实践,熟悉分布式训练、混合精度和显存优化,能够排查数值稳定性、数据与性能问题。
- 能够设计有说服力的对照实验,区分数据、模型、训练分布和推理机制带来的影响。
- 对可交互生成有持续兴趣,愿意查看生成视频、复现失败案例,并把研究结论落实为可运行的系统。
以下经历会是加分项:
- 自回归或因果视频模型、长序列建模、长期记忆、蒸馏或量化经验。
- 熟悉视频生成模型的流式推理与推流加速,有分块生成、KV Cache 优化、编解码流水线或低延迟视频推流实践者优先。
- 游戏引擎、计算机图形学、三维视觉、场景重建或仿真数据生成经验。
- 主导过生成模型训练或交互式产品落地,有相关论文、开源项目或可展示的系统。
欢迎随简历附上代表性论文、代码或演示视频,并说明你负责的部分、解决的问题和实验结论。我们重视你把一个问题研究清楚、实现出来并验证有效的能力。
岗位标签
NEW
特色标签
Python、Shell、云计算、交互式视频合成、低延迟推理、内容、分布式训练、动态世界建模、历史缓存机制、发表算法相关优秀论文、可交互世界生成、可控视频生成、因果时序建模、因果视频建模、图像、图像算法、在线视频解码、多卡并行训练、多模态条件注入、多模态算法、大模型分布式训练、大模型算法、实时渲染平台、实时解码、少步蒸馏、引擎驱动场景、扩散生成模型、时序记忆模块、机器学习、条件信息编码、条件特征融合、模型加速/性能优化、模型推理加速、流式视频生成、深度学习、游戏、游戏渲染引擎、生成式世界模型、生成式扩散模型、算法工程化经验、自回归视频生成、视频、视频世界模型、视频扩散模型、长序列记忆、集群训练优化