jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

视频理解算法实习生-【可灵AI专项】

Intern

Company Kuaishou

Focus Tech · Algorithm

Location 北京

Published August 27, 2026

岗位职责

  1. 视频理解数据与算法建设:参与视频多模态大模型相关的数据建设与算法优化,围绕视频内容理解、时序事件识别、动作/场景/人物关系建模、视频字幕与语音信息融合等任务,协助构建高质量视频理解数据集,为 Keye 视频基础能力及下游业务效果提升提供数据与算法支撑;
  2. 视频 Agent 能力建设:围绕视频场景下的智能 Agent 能力,参与复杂视频任务的拆解与数据构建,包括视频问答、长视频推理、多轮交互、工具调用、视频内容检索、视频剪辑规划、视频分析报告生成等方向,探索如何让模型基于视频内容进行更准确的理解、规划与决策;
  3. 视频数据 Pipeline 与评测体系建设:参与视频数据的采集、筛选、标注、质检、清洗与评估流程建设,协助优化视频理解任务中的数据标准与评测方法,针对真实业务反馈,分析模型在时间理解、因果推理、细粒度视觉识别、音画对齐、多模态语义一致性等方面的问题,推动数据驱动的模型迭代;
  4. 前沿技术调研与实验复现:跟踪视频理解、多模态大模型、Video Agent、Video2Code、视频长上下文建模等方向的前沿论文和开源项目,参与技术调研、实验复现、Benchmark 构建与效果分析,将前沿方法应用到实际业务问题中。

任职要求

  1. 计算机、人工智能、软件工程、自动化、电子信息等相关专业在读本科、硕士或博士,具备计算机视觉、自然语言处理、多模态学习、视频理解等相关经验者优先;
  2. 熟悉深度学习基础,了解 Transformer、多模态大模型、视觉语言模型、视频理解模型等相关技术,对视频分类、视频问答、时序定位、动作识别、OCR、ASR、视觉内容理解、RAG 或 Agent 方向有实践经验者优先;
  3. 熟练使用 Python,熟悉 PyTorch 或其他深度学习框架,具备良好的代码实现与调试能力,了解数据处理、模型训练、推理部署、API 调用、Prompt 构建、自动化评测等流程者优先;
  4. 具备较强的数据敏感度,能够从模型 badcase、业务反馈或评测结果中分析问题,设计数据改进方案,熟悉大规模数据处理、视频数据清洗、标注规范设计、质量评估或可视化分析工具者优先。

加分项,有以下经验者优先:

  1. 视频理解、多模态大模型、Agent、Video2Code 相关论文复现或项目经验;
  2. 参与过高质量开源项目、顶会论文、竞赛获奖或实习项目;
  3. 熟悉 FFmpeg、OpenCV、Whisper、OCR、向量检索、vLLM、TensorRT 等工具或框架。