摘要
基于可验证奖励的强化学习(RLVR)显著提升了大语言模型的抽象推理能力,但在大视觉语言模型(LVLM)中受限于结构性表示瓶颈。现有方法缺乏对视觉信息的显式建模,阻碍了视觉表示与强化学习优化的紧密结合。为此,本文提出 KAWHI,一种即插即用的奖励重加权机制,将结构化视觉信息融入统一奖励策略优化中。该方法通过分层几何聚合定位语义显著区域,利用结构化归因识别关键视觉注意力头,并执行段落级信用重分配,以对齐空间视觉证据与决定性推理步骤。实验表明,KAWHI 能显著提升多种优化方法在多模态推理基准上的性能。
AI 推荐理由
论文核心解决多模态推理瓶颈,通过视觉对齐提升 LVLM 推理能力。
研究机构
EPIC Lab, SJTU
论文信息