达摩院-多模态大模型算法工程师(视频理解方向)-杭州
Company Alibaba
Focus Tech · Algorithm
Location 杭州
Published September 22, 2026
岗位职责
- 多模态大模型的视频理解应用:基于主流多模态大模型,通过微调、后训练与模型适配,解决视频内容理解、长视频结构化、视频问答、时序定位及复杂事件推理等问题,推动模型能力落地。
- 跨模态融合理解:融合音频(语音/音效/说话人)、文本(字幕、ASR 转写、OCR、元数据)等多源信息,设计跨模态对齐与融合方案,提升复杂场景下的理解效果与鲁棒性。
- 模型效率与部署成本优化:面向长视频推理成本问题,通过蒸馏、剪枝、量化、视觉 token 压缩及推理引擎优化降低资源开销,探索跨帧特征复用、Tracking 辅助推理等效率方案。
- 数据与评测体系:构建高质量多模态指令与评测数据(视觉-音频-文本对齐),搭建覆盖多任务的数据清洗、标注与评测 pipeline,支撑模型效果迭代。
- 技术前瞻与创新落地:持续跟踪 Video-LLM 与多模态大模型前沿进展,研判关键技术演进方向,推动前沿技术的引入、适配与创新,实现其在视频理解场景中的业务价值转化。
任职要求
-
计算机、人工智能、电子信息、数学等相关专业,硕士及以上学历,具备 3 年以上视频/多模态算法研发经验。
-
具备扎实的深度学习与计算机视觉基础,熟练使用 Python 与 PyTorch;理解多模态大模型原理,具有模型微调及 SFT、DPO/GRPO 等后训练实践,能用于解决视频理解问题。
-
具备完整的项目经验,能独立完成从需求分析、方案设计、算法研发到上线交付的全流程;具备较强的问题分析能力,能在效果、性能、开发成本与业务收益之间合理取舍。
-
具备良好的沟通协作能力,能与业务、产品及工程团队进行技术沟通和项目推进。 加分项
-
有音视频-文本跨模态融合、长视频/长上下文建模的研究或落地经验。
-
有较强工程与系统落地能力:对 TensorRT、ONNX Runtime、CUDA、算子优化、混合精度或端侧/资源受限部署有实际经验,或有大规模视频理解/搜索/处理系统、视频理解 Agent 的落地经验。
-
在 CVPR、ICCV、ECCV、ACM MM、NeurIPS、ICML、ICLR、TIP 等顶会或顶刊发表过论文,或在开源社区有较大影响力。
-
有独立负责技术方向、带领小型项目或指导初级算法工程师及实习生的经验。
岗位标签
NEW