【快Star】多模态大模型算法工程师-Keye-【可灵AI专项】
Company Kuaishou
Focus Tech · Algorithm
Location 北京
Published July 15, 2026
岗位职责
团队介绍:Keye多模态大模型团队,作为「基座研发 + 产品赋能」双轮驱动的团队,致力于打通从Data到Product的最后一公里,打造最强的多模态理解底座。 1、深耕基座:攻坚多模态基座核心架构,探索Scaling Law的极致边界; 2、数据为王:构建工业级数据清洗与自动化评测体系,用高质量数据重塑智能; 3、进化智能:突破强化学习与推理增强技术,让模型更聪明、更可控。
依托可灵生态,与团队一同打造最具行业竞争力的多模态基座模型。我们的研发体系覆盖大模型全链路,候选人的工作方向涵盖但不限于以下三大核心领域——你可以结合自身的学术背景与技术兴趣自由选择,我们也非常鼓励跨界探索与能力延展:
方向一:多模态基座与预训练算法方向 聚焦架构范式革新,突破当前"语言模型+视觉适配器"拼接式设计的能力天花板,构建原生支持图/文/音/视频统一表征的新一代多模态架构; 参与万亿级参数多模态MoE模型的训练探索与稀疏注意力机制优化,设计更高效的跨模态语义对齐策略与超长上下文(Ultra-long Context)模型; 参与图像与视频场景的联合建模与因果视觉表征学习,探索并在超大规模集群训练中验证多模态Scaling Laws。
方向二:多模态后训练与智能体(Agent)演进方向 参与前沿模型后训练方法(如RLHF、PPO、OPD等对齐技术)的研究与工程实践,持续提升模型在复杂任务中的推理、理解与泛化能力; 探索多模态智能体在复杂场景中的能力落地,涵盖工具调用(Tool-use)、代码执行、信息检索、长程规划与闭环决策; 参与视觉智能体的底层能力建设,探索以视觉感知驱动的自主决策与任务执行范式(涵盖GUI操控、视频理解与个人助手等),并参与构建自动化迭代体系。
方向三:多模态数据治理与飞轮建设方向 参与大规模混合模态数据的深度治理,负责高精度OCR、高质量Caption生成及语义对齐数据合成,从根本上解决数据噪声与模态错位难题; 围绕智能Agent的推理规划与多轮交互,拆解真实场景需求,构建高质量的推理、决策与指令交互数据集; 参与商业化数据Pipeline与“用户交互-数据飞轮”闭环建设,通过高质量训练数据构建(Data-centric AI),实现完全数据驱动的模型自适应演进。
任职要求
1、计算机科学与技术、人工智能、自动化、数学等相关专业的应届硕士或博士; 2、具备扎实的计算机多模态/NLP/CV理论基础,有良好的数学底子,精通Python编程,具备极强的独立开发与调试能力; 3、熟悉至少一种主流深度学习或分布式训练框架(如 PyTorch、Megatron-LM、DeepSpeed 等); 4、热衷于通用大模型(AGI)及新兴技术领域,深度认同数据与算法双轮驱动的价值,具备良好的沟通协作能力与极客精神。
加分项: 1、在 NeurIPS、ICLR、ICML、CVPR、ACL 等人工智能顶级会议或期刊上作为核心作者发表过高质量研究论文; 2、在 NOI、ACM-ICPC 等国内外知名算法竞赛中取得优异成绩; 3、有深度参与知名开源大模型项目经历,或在多模态、RLHF、Agent等前沿方向有扎实的实战经验。