研究型实习生-面向长时交互的流式视频记忆网络研究

Intern

Company Antgroup

Focus Tech · Other

Location 北京, 上海, 杭州

Published September 18, 2026

岗位职责

研究领域: 大模型智能体 项目简介: 在AI眼镜、视频交互等实时多模态交互场景中,系统需要持续处理长时间的流式视频输入,并在交互过程中逐步构建和更新对用户、环境及上下文的理解。现有的视频理解方法主要面向离线场景,存在以下核心技术挑战: 流式处理的实时性瓶颈:传统方法依赖完整视频片段进行批处理,难以满足实时交互的低延迟要求 长时记忆的选择性构建难题:缺乏有效的机制来判断哪些多模态信息需要长期保留,哪些可以遗忘 跨模态信息的时序融合问题:视觉、音频、文本等多模态信息在时间维度上的异步性和不对齐,导致理解碎片化 这些技术瓶颈限制了多模态交互系统在复杂场景下的理解深度和服务连贯性。

任职要求

研究领域:

  • 目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位
  • 具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go
  • 具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用:
  • 对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色
  • 在国际会议上或核心期刊发表一份或多份出版物或论文
  • 至少3个月的全职工作

特色标签

AR眼镜、C/C++、Golang、Java、Python、SLAM、三模态、云原生、云计算、低延迟交互、分布式计算、即时交互、发表算法相关优秀论文、图像、图像算法、图文声、在线视频流、增强现实眼镜、多模态算法、多模态融合、大模型算法、实时响应、实时视频流、持久记忆、推荐、时序记忆、智能体、智能眼镜、机器人、模型加速/性能优化、流式记忆网络、直播、短视频、算法工程化经验、聊天机器人、自动驾驶、视听文融合、视音文、视频、视频分析、视频时序记忆、视频解析、视频记忆模型、视频语义理解、语音、跨模态交互、连续视频流、长期记忆