Visual Reasoning Agentic Framework Document VQA Evidence Aggregation
摘要

多页文档视觉问答需对长篇幅、高密度文档中的语义、布局及视觉元素进行推理。现有无 OCR 方法在容量与精度间难以权衡。本文提出 Doc-V*,一种无 OCR 的智能体框架,将任务建模为序列证据聚合过程。该框架从缩略图概览出发,主动通过语义检索导航并获取目标页面,在结构化工作记忆中聚合证据以支持接地推理。经专家轨迹模仿学习与组相对策略优化训练,Doc-V* 在五个基准测试中表现优异,显著提升了跨域性能。

AI 推荐理由

论文核心提出交互式视觉推理框架,通过证据聚合实现多页文档的深层推理。

研究机构
School of Software Engineering, Huazhong University of Science and Technology
论文信息
作者 Yuanlei Zheng, Pei Fu, Hang Li, Ziyang Wang, Yuyi Zhang et al.
发布日期 2026-04-15
arXiv ID 2604.13731
相关性评分 9/10 (高度相关)