Visual Reasoning VLM Self-Revisit Reinforcement Learning
摘要

视觉语言模型(VLM)虽具备图像推理能力,但稳健推理常需重新定位中间步骤的视觉证据。现有方法依赖缩放或裁剪等外部操作,导致重复编码并干扰推理轨迹。本文提出端到端自回顾框架 SIEVE,利用模型内部信号提取显著区域嵌入,并在需要时注入推理链,无需外部工具调用。通过强化学习训练模型自主触发视觉回顾及检索相关区域。实验表明,该方法在多个基准测试中平均提升 8% 的性能,有效改善了感知、推理及幻觉问题。

AI 推荐理由

论文核心提出通过迭代证据细化提升视觉推理能力,直接针对推理机制优化。

研究机构
罗格斯大学计算机科学系
论文信息
作者 Zeru Shi, Kai Mei, Yihao Quan, Dimitris N. Metaxas, Ruixiang Tang
发布日期 2026-03-14
arXiv ID 2603.14117
相关性评分 9/10 (高度相关)