LVLM Visual Memory Attention Mechanism Long-context Generation
摘要

自回归大型视觉语言模型(LVLM)虽在多模态任务中表现优异,但面临“视觉信号稀释”现象,即文本历史积累导致视觉注意力随生成长度增加而衰减。为此,本文提出持久视觉记忆(PVM),一种轻量级可学习模块,旨在确保持续、按需的视觉感知。PVM 作为前馈网络的并行分支,建立与距离无关的检索路径,直接提供视觉嵌入以缓解深层生成中的信号抑制。实验表明,PVM 在参数量几乎不变的情况下,显著提升了模型在复杂推理任务中的准确率,并能抵抗长度引起的信号衰减,加速内部预测收敛。

AI 推荐理由

论文提出持久视觉记忆模块,核心解决长序列生成中的视觉信号衰减问题,属记忆机制研究。

研究机构
Shanghai AI Laboratory The Chinese University of Hong Kong Shanghai Jiao Tong University Nanjing University Tongji University
论文信息
作者 Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Zefeng He et al.
发布日期 2026-05-01
arXiv ID 2605.00814
相关性评分 9/10 (高度相关)