Company Dingtalk
Focus Tech · Algorithm
Location 杭州
Published August 20, 2026
负责面向真实业务场景的视频分析 Agent 算法研发,围绕实时视频理解与离线长视频复杂任务分析两大方向,构建具备感知、记忆、规划、推理与工具调用能力的多模态智能系统。
计算机、人工智能、模式识别、自动化等相关专业,本科及以上,具备扎实的机器学习/深度学习基础。 熟悉计算机视觉与视频理解核心方向,具备检测、分割、跟踪、动作识别、时序建模、事件分析等相关经验。 熟悉 VLM/MLLM/Omni 多模态模型原理及应用,有视频理解、多模态问答、视频 Agent 或具身/交互式智能体经验者优先。 熟悉大模型后训练方法,包括 SFT、DPO、RL/RLHF 等,对 Agent 能力对齐、任务分解、规划推理有实战经验。 具备 Agent/tool use/function calling/RAG 相关经验,能够设计基于工具增强的多轮推理流程。 熟悉长短期记忆、上下文管理、时序信息压缩与检索机制,有长视频理解或流式视频分析经验者优先。 熟练使用 PyTorch,具备模型训练、微调、部署与性能优化能力;有低延迟推理、流式系统优化经验者优先。 具备较强的问题抽象与系统设计能力,能够从业务场景出发定义任务、构建数据、设计评测并推动落地。
优先条件 有工业质检、巡检、安防、SOP 合规、视频交互等真实场景落地经验。 有长视频复杂任务分析、视频 CoT/规划推理、视频 Agent、Agentic RL 相关经验。 有多模态大模型微调、蒸馏、对齐、推理加速或线上部署经验。 在 CV、MM、NLP、Agent、RL 等方向有高水平论文、开源项目或竞赛成果。
加分项关键词 视频理解、Streaming Video、VLM、MLLM、Omni、Agent、Planning、Reasoning、Memory、Tool Use、Function Calling、RAG、SFT、DPO、RLHF、Agentic RL、工业质检、巡检、SOP