Visual RAG Reinforcement Learning Complex Reasoning LVLM
摘要

检索增强生成(RAG)扩展了大型视觉语言模型的外部视觉知识,但现有系统常忽略复杂推理所需的细粒度视觉语义。为此,本文提出 UniDoc-RL,一个统一强化学习框架,使智能体协同执行检索、重排序、主动视觉感知及推理。该方法将视觉信息获取建模为具分层动作空间的序列决策问题,从粗略文档检索逐步细化至图像选择与区域裁剪,以聚焦高信息密度区域。此外,引入基于任务的密集多奖励机制,利用组相对策略优化实现端到端训练,无需独立价值网络。实验表明该方法在多个基准上显著优于现有技术。

AI 推荐理由

论文核心解决复杂视觉推理中细粒度语义缺失问题,通过分层动作优化推理过程。

研究机构
DeepGlint
论文信息
作者 Jun Wang, Shuo Tan, Zelong Sun, Tiancheng Gu, Yongle Zhao et al.
发布日期 2026-04-16
arXiv ID 2604.14967
相关性评分 9/10 (高度相关)