研究型实习生-交互式视频生成算法研究
Company Antgroup
Focus Tech · Algorithm
Location 北京, 杭州
Published May 28, 2026
岗位职责
研究领域: 多模态 项目简介: 我们正在探索面向下一代多模态原生产品的世界模型与视频生成技术,重点方向包括:实时视频生成、长视频自回归建模、可交互世界模型等,以及面向 游戏 / 仿真场景的高效视觉预测模型。
当前视频生成与世界模型在效果上持续提升,但在实际落地中面临显著的算费与推理效率瓶颈:长序列视频生成成本高、实时交互延迟大、自回归范式误差累积与长视频 drift、训练与推理资源消耗大。我们希望通过模型结构、训练范式、推理加速、压缩蒸馏和系统工程等多方面创新,系统性降低世界模型和长视频生成的计算成本,提升生成质量,推动相关能力从 Demo 走向可规模化应用。
该项目适合对前沿生成模型有强烈兴趣,并希望在真实复杂场景中解决核心技术问题的研究型实习生。研究方向可以围绕以下一个或多个方向展开
- 实时视频生成与低延迟推理 面向实时交互式场景,研究低延迟视频生成框架,包括: Streaming Video Generation 少步数生成方法(Consistency Models、蒸馏类方法如 LCM / DMD等) 实时帧预测与补帧 模型并行、流水线并行与端到端推理优化
重点解决生成速度、画质、稳定性和成本之间的系统性 trade-off。
- 长视频自回归生成与推理加速 针对长视频生成中的自回归计算开销,研究高效生成机制,包括: KV Cache 管理:缓存量化、驱逐、复用 Sliding Window / Chunked Attention 分层自回归生成 稀疏注意力与时空因果建模 Speculative Decoding for Video Token pruning / token merging
目标是在尽可能保持生成质量的前提下,显著降低长视频生成的推理成本。
- 世界模型与视频生成模型架构 研究适合长视频、多视角、可交互环境的生成式世界模型架构,包括但不限于: 自回归视频生成模型 Latent World Model 动作条件视频预测模型 多智能体交互场景建模 视觉 tokenization 与时空压缩表示
重点关注模型在长时序一致性、可控性、交互响应速度和生成质量
任职要求
基础要求
- 计算机、人工智能、机器学习、自动化、数学等相关专业在读,硕士或博士优先
- 熟悉深度学习基础,理解 Transformer、Diffusion Model、Auto-regressive Model 等主流生成模型
- 熟练使用 PyTorch,具备独立实现和调试深度学习模型的能力
- 具备较强的论文阅读、问题抽象和实验分析能力
- 对世界模型、视频生成有强烈兴趣
加分项 -对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色 -熟悉长上下文建模、自回归生成、KV Cache、Attention 优化等技术 -有推理加速、模型压缩、量化、蒸馏、TensorRT / vLLM / FlashAttention 等经验 -有大规模训练、多卡训练、分布式训练或 GPU 性能优化经验 -熟悉视频 VAE、tokenizer、latent representation、spatiotemporal modeling -在顶会、期刊、arXiv 或开源社区有相关成果
特色标签
KV 缓存优化、Python、低延迟视频生成、分布式训练、加速蒸馏、动态内容生成、去噪生成模型、发表算法相关优秀论文、在线视频生成、多模态学习、多模态建模、多模态生成、多模态算法、大模型算法、并行计算、强化学习、扩散模型、时序自回归、时序视频生成、时空分词、时空注意力、概率生成模型、模型加速/性能优化、模型蒸馏、注意力机制、注意力缓存、流式视频生成、深度学习、游戏、潜在世界模型、潜在表示编码、环境建模、生成式世界模型、知识蒸馏、稀疏注意力、算法工程化经验、自回归建模、自回归生成、自注意力、视觉令牌化、视频合成、键值缓存