摘要
针对流式全模态视频理解中连续感知与实时交互的缺失,本文提出 StreamOV 框架。现有方法难以管理长期增长的音视频上下文且无法自主触发响应。StreamOV 引入多模态证据引导的长短期记忆机制,在固定预算下将历史上下文压缩为紧凑信息;同时采用隐藏状态驱动的触发器决定响应时机,避免显式沉默令牌生成。此外,构建了首个在线多轮评估基准 SOVBench。实验表明该方法在多种流式及离线基准上均达到最先进水平。
AI 推荐理由
论文核心提出证据引导的长短期记忆机制,解决流式视频中长上下文管理问题。
研究机构
Shanghai Innovation Institute
Shanghai Artificial Intelligence Laboratory
Fudan University
Nanjing University
Huazhong University of Science and Technology
论文信息