摘要
视觉语言模型(VLM)虽具备图像推理能力,但稳健推理常需重新定位中间步骤的视觉证据。现有方法依赖缩放或裁剪等外部操作,导致重复编码并干扰推理轨迹。本文提出端到端自回顾框架 SIEVE,利用模型内部信号提取显著区域嵌入,并在需要时注入推理链,无需外部工具调用。通过强化学习训练模型自主触发视觉回顾及检索相关区域。实验表明,该方法在多个基准测试中平均提升 8% 的性能,有效改善了感知、推理及幻觉问题。
AI 推荐理由
论文核心提出通过迭代证据细化提升视觉推理能力,直接针对推理机制优化。
研究机构
罗格斯大学计算机科学系
论文信息