Visual Reasoning RAG Agent Reinforcement Learning
摘要

视觉检索增强生成(VRAG)赋能视觉语言模型处理富文本文档。针对复杂查询所需的多步推理,现有代理式 VRAG 面临视觉证据稀疏与长程搜索漂移两大瓶颈。为此,本文提出 VISOR 框架,包含用于渐进式跨页推理的结构化证据空间、视觉动作评估修正机制,以及结合滑动窗口与意图注入的动态轨迹策略以缓解搜索漂移。该方法基于 GRPO 强化学习训练,在多个基准测试中实现了长程视觉推理任务的最先进性能与高效性。

AI 推荐理由

论文核心解决多步视觉推理中的证据稀疏与长程漂移问题,提出跨页推理机制。

研究机构
Soochow University Baidu Inc. Beijing, China Suzhou, China
论文信息
作者 Yucheng Shen, Jiulong Wu, Jizhou Huang, Dawei Yin, Lingyong Yan et al.
发布日期 2026-04-10
arXiv ID 2604.09508
相关性评分 9/10 (高度相关)