(可灵AI专项)多模态理解算法工程师
Company Kuaishou
Focus Tech · Algorithm
Location 北京
Published April 20, 2026
岗位职责
1、大规模视频理解:负责可灵海量视频数据的打标分类、语义分割、文字识别、Caption生成、聚类分析等工作; 2、模型开发与优化:基于CNN、VLM等技术推进模型训练、微调、评测及高效部署,推动模型在实际场景中的大规模应用; 3、技术研究与创新:聚焦多模态视频生成领域前沿课题,探索生成模型的数据采样技术,提升生成模型的数据使用效率和语义响应能力,打造在业界的领先技术优势; 4、跨领域协作:参与跨团队跨部门技术协同,推动Human in the loop在视频生成领域的研究落地。
任职要求
1、学历与经验:硕士及以上学历,3年及以上相关工作经验。计算机视觉、自然语言处理或多模态方向背景优先; 2、学术背景:具备较强的学术调研能力,能快速理解和实现论文中的算法;有高质量论文发表、开源项目贡献、ACM竞赛或相关学术比赛获奖经历者优先; 3、深度学习能力:熟练掌握深度学习框架(如PyTorch、TensorFlow),有模型训练、压缩、蒸馏和微调经验;熟悉DeepSpeed等加速工具优先; 4、工程能力:具备优秀的独立开发与调试能力,熟悉Python服务开发,Hive大数据处理等技术; 5、团队协作:具备良好的沟通能力,乐于学习与分享,能够与团队高效协作解决问题。 【加分项】 1、熟悉视频处理相关工具与技术,如FFmpeg、OpenCV等; 2、在视频理解、多模态建模方向有实战项目经验。