【快Star】理解生成一体化算法研究员-【可灵AI】

Campus

Company Kuaishou

Focus Tech · Algorithm

Location 深圳, 北京

Published August 11, 2026

岗位职责

理解生成一体化架构升级,同时打通图视频统一底座;理解能力正在成为生成质量的天花板。Google Nano Banana 2. GPT Image 2.0 都在朝这个方向收敛。我们的下一代模型需要在多模态理解上有完整 hands-on 经验的人,一起定义新架构——而不是执行已定方案。

你将主导:

  1. 理解生成一体化架构设计;
  2. Thinking / Chain-of-Thought for Image Generation;
  3. Long Visual Context Compression;
  4. 大规模多模态预训练;
  5. 后训练与对齐;
  6. 图视频统一探索。

我们能提供:

  1. 真正的架构话语权——你的判断直接写进技术路线图;
  2. 经过验证的执行力和产品力——O1 和 3.0 Omni 不是 paper,是每天上百万用户在用的产品;
  3. 充足资源——中心级千卡算力 + 完整数据基础设施;
  4. 图视频协同的独特 scope——国内少数同时在图像和视频头部的平台。

任职要求

  1. 博士 or 顶会一作 or 业界核心项目参与者;
  2. 有大规模多模态理解/生成模型 hands-on 经验;
  3. 深入理解 MLLM / Diffusion:视觉 encoder、跨模态对齐、长 context、多图交互;
  4. 有大规模多模态预训练经验(数据配比、训练稳定性、loss 平衡);
  5. 后训练全链路至少亲手做过两个阶段。

加分项:

  1. 对"理解生成如何深度一体化"有自己的技术判断;
  2. 深入研究或做过 Transfusion / Janus / BAGEL / MetaQuery 等统一架构;
  3. 有大规模弱关联数据挖掘和预训练经验;
  4. 其他参考项如 Visual Tokenizer / Compressor、Chain-of-Thought、视频理解或生成、开源影响力。