Document Understanding Grounded Reasoning Multimodal LLM Layout Perception
摘要

多模态大模型的文档理解不仅需要准确答案,更需显式的证据接地推理。针对现有模型布局编码与思维链交互松散的问题,本文提出 DocCogito 框架。该框架集成全局布局感知与结构化区域接地推理,引入轻量级布局塔提取结构先验,并设计视觉语义链(VSC)作为比自然语言更精确的结构化表示来监督中间推理。通过渐进式训练策略及细粒度区域置信度奖励增强机制,实现了布局先验与推理执行的内耦合。实验表明该方法在六个基准测试中表现优异,其中四项达到最先进水平。

AI 推荐理由

论文核心提出视觉语义链(VSC)机制,旨在实现基于证据的细粒度推理,属于推理能力研究。

研究机构
复旦大学,上海,中国
论文信息
作者 Yuchuan Wu, Minghan Zhuo, Teng Fu, Mengyang Zhao, Bin Li et al.
发布日期 2026-03-08
arXiv ID 2603.07494
相关性评分 9/10 (高度相关)