摘要
潜在视觉推理通过在文本生成前插入连续潜在令牌来直接利用视觉证据。然而,其在推理阶段的必要性尚不明确。研究发现,替换或移除这些令牌对性能影响甚微,且强化学习会抑制其生成。本文主张应关注潜在令牌如何引导学习而非其在推理时的存在形式。为此,提出一种基于注意力的奖励机制,鼓励潜在令牌与后续文本交互,从而在保持纯文本推理灵活性的同时提升感知与视觉推理基准的性能。结果表明,即使推理时不显式生成潜在令牌,该机制仍能塑造更好的视觉 grounding 和更准确的文本推理。
AI 推荐理由
论文核心研究多模态场景下的潜在视觉推理机制、训练策略及其对推理性能的影响。
研究机构
北卡罗来纳州立大学
加州大学圣地亚哥分校
杜克大学
阿拉巴马大学伯明翰分校
俄亥俄州立大学
论文信息