Long-Video QA Video Memory VLM Context Compression
摘要

长视频问答对视觉语言模型极具挑战,因关键证据稀疏且分散。现有方法多基于孤立帧,难以捕捉连贯的事件级语义。为此,本文提出 MemoryCard,一种基于视频记忆的增强框架。该框架通过自阅读过程将视频分割为语义连贯的单元,生成事件级摘要并选取代表性视觉时刻,渲染为统一的“记忆卡”用于检索与问答。实验表明,在同等视觉 token 预算下,该方法显著提升了长视频问答性能,准确率相对提升最高达 21.8%。

AI 推荐理由

提出基于视频记忆的增强框架,核心创新在于构建语义连贯的记忆单元以解决长视频上下文问题。

研究机构
东北大学计算机科学与工程学院,辽宁沈阳,中国 北京邮电大学计算机学院,北京,中国
论文信息
作者 Qing Yang, Pengcheng Huang, Xinze Li, Zhenghao Liu, Yukun Yan et al.
发布日期 2026-06-04
arXiv ID 2606.05917
相关性评分 9/10 (高度相关)