Long Document Understanding Visual Reasoning Evidence Grounding MLLM
摘要

现有大规模多模态语言模型在长文档理解任务中随长度增加性能显著下降,主要源于信噪比低及监督信号稀缺。本文提出一种要求模型执行“分析、定位、推理”结构化工作流的新范式。为此设计了包含知识蒸馏监督微调与证据感知组相对策略优化的两阶段训练框架,并引入证据引导的分辨率分配策略以缓解内存限制。实验表明,该方法在域内及域外任务中均表现优异,具备从短页到超长文档的鲁棒泛化能力。

AI 推荐理由

论文核心提出结构化视觉推理工作流,通过证据定位与推理联合优化解决长文档理解难题。

研究机构
华中科技大学 华为技术有限公司
论文信息
作者 Hao Yan, Yuliang Liu, Xingchen Liu, Yuyi Zhang, Minghui Liao et al.
发布日期 2026-04-14
arXiv ID 2604.12812
相关性评分 9/10 (高度相关)