摘要
多页文档视觉问答需对长篇幅、高密度文档中的语义、布局及视觉元素进行推理。现有无 OCR 方法在容量与精度间难以权衡。本文提出 Doc-V*,一种无 OCR 的智能体框架,将任务建模为序列证据聚合过程。该框架从缩略图概览出发,主动通过语义检索导航并获取目标页面,在结构化工作记忆中聚合证据以支持接地推理。经专家轨迹模仿学习与组相对策略优化训练,Doc-V* 在五个基准测试中表现优异,显著提升了跨域性能。
AI 推荐理由
论文核心提出交互式视觉推理框架,通过证据聚合实现多页文档的深层推理。
研究机构
School of Software Engineering, Huazhong University of Science and Technology
论文信息