摘要
长视频问答对视觉语言模型极具挑战,因关键证据稀疏且分散。现有方法多基于孤立帧,难以捕捉连贯的事件级语义。为此,本文提出 MemoryCard,一种基于视频记忆的增强框架。该框架通过自阅读过程将视频分割为语义连贯的单元,生成事件级摘要并选取代表性视觉时刻,渲染为统一的“记忆卡”用于检索与问答。实验表明,在同等视觉 token 预算下,该方法显著提升了长视频问答性能,准确率相对提升最高达 21.8%。
AI 推荐理由
提出基于视频记忆的增强框架,核心创新在于构建语义连贯的记忆单元以解决长视频上下文问题。
研究机构
东北大学计算机科学与工程学院,辽宁沈阳,中国
北京邮电大学计算机学院,北京,中国
论文信息