Streaming Video Long-term Memory Omni-modal Proactive Interaction
摘要

针对流式全模态视频理解中连续感知与实时交互的缺失,本文提出 StreamOV 框架。现有方法难以管理长期增长的音视频上下文且无法自主触发响应。StreamOV 引入多模态证据引导的长短期记忆机制,在固定预算下将历史上下文压缩为紧凑信息;同时采用隐藏状态驱动的触发器决定响应时机,避免显式沉默令牌生成。此外,构建了首个在线多轮评估基准 SOVBench。实验表明该方法在多种流式及离线基准上均达到最先进水平。

AI 推荐理由

论文核心提出证据引导的长短期记忆机制,解决流式视频中长上下文管理问题。

研究机构
Shanghai Innovation Institute Shanghai Artificial Intelligence Laboratory Fudan University Nanjing University Huazhong University of Science and Technology
论文信息
作者 Ming Xie, Zizheng Huang, Xudong Tan, Chao Wang, Xiangyu Zeng et al.
发布日期 2026-05-25
arXiv ID 2605.25621
相关性评分 9/10 (高度相关)