多模态理解与生成统一架构核心研究员-【可灵AI】
Company Kuaishou
Focus Tech · Algorithm
Location 北京
Published April 20, 2026
岗位职责
现在在做什么: 1、理解生成一体化架构升级,同时打通图视频统一底座; 2、理解能力正在成为生成质量的天花板。Google Nano Banana 2、GPT Image 2.0 都在朝这个方向收敛。我们的下一代模型需要在多模态理解上有完整 hands-on 经验的人,一起定义新架构——而不是执行已定方案。
你将主导: 1、理解生成一体化架构设计; 2、Thinking / Chain-of-Thought for Image Generation; 3、Long Visual Context Compression; 4、大规模多模态预训练; 5、后训练与对齐; 6、图视频统一探索。
我们能提供: 1、真正的架构话语权——你的判断直接写进技术路线图; 2、经过验证的执行力和产品力——O1 和 3.0 Omni 不是 paper,是每天上百万用户在用的产品; 3、充足资源——中心级千卡算力 + 完整数据基础设施; 4、图视频协同的独特 scope——国内少数同时在图像和视频头部的平台。
任职要求
必备: 1、2-3 年大规模多模态理解/生成模型 hands-on 经验,主导过完整项目或者核心贡献者; 2、深入理解 MLLM / Diffusion:视觉 encoder、跨模态对齐、长 context、多图交互; 3、有大规模多模态预训练经验(数据配比、训练稳定性、loss 平衡); 4、后训练全链路至少亲手做过两个阶段; 5、博士 or 顶会一作 or 业界核心项目主导者。
我们更看重: 1、对"理解生成如何深度一体化"有自己的技术判断; 2、深入研究或做过 Transfusion / Janus / BAGEL / MetaQuery 等统一架构; 3、有大规模弱关联数据挖掘和预训练经验。 加分: Visual Tokenizer / Compressor、Chain-of-Thought、视频理解或生成、开源影响力。