摘要
针对大型多模态模型在长期视频理解中的局限,现有方法常独立压缩帧,难以处理需理解完整事件的任务。本文提出一种带记忆反馈的问题引导式视觉压缩框架(QViC-MF),颠覆传统单向感知流程,建立反馈驱动机制。其核心是问题引导的多模态选择性注意力模块,能从当前片段及记忆中的历史帧保留与问题相关的视觉信息。该压缩器与记忆反馈迭代工作,显著提升了长期视频理解任务的性能,在多个基准测试中超越最先进方法。
AI 推荐理由
论文核心提出基于记忆反馈的视觉压缩机制,重构感知与记忆交互架构。
研究机构
富士通研究所
麦考瑞大学
论文信息