摘要
视觉 - 语言模型(VLMs)虽表现优异,但常过度依赖文本线索而忽视视觉证据,导致回答缺乏依据。为此,本文提出 Saliency-R1 框架,旨在提升 VLM 推理的可解释性与忠实度。该方法引入一种新型显著性图技术,无需额外计算开销即可高亮关键图像区域,并追踪视觉信息在推理过程中的流动。利用显著性图与人工标注边界框的重叠作为奖励函数,结合组相对策略优化(GRPO)对齐关键区域,引导模型在推理时聚焦相关视觉内容。实验表明,该方法显著提升了推理的忠实度、可解释性及整体任务性能。
AI 推荐理由
论文核心在于通过显著性图对齐奖励机制,增强多模态模型的推理可解释性与忠实度。
研究机构
The Chinese University of Hong Kong, Hong Kong, China
City University of Hong Kong, Hong Kong, China
论文信息