摘要
多模态大语言模型(MLLMs)在扩展推理模式下常出现感知受损,尤其在视觉问答任务中。本文指出注意力分散是根本原因:在多步推理中,模型的视觉注意力变得散乱并偏离问题相关区域。通过分析注意力图谱,发现推理提示显著降低了对关键区域的关注。基于此,提出无需训练的视觉区域引导注意力(VRGA)框架,利用熵 - 焦点准则选择并重加权视觉头,有效引导模型在推理时聚焦相关问题区域。实验表明该方法显著缓解了感知退化,提升了视觉定位与推理准确性。
AI 推荐理由
论文核心研究多模态模型在推理过程中的感知受损机制及注意力分散问题,并提出解决方案。
研究机构
清华大学深圳国际研究生院
华为技术有限公司
国防科技大学测试中心
论文信息