Long-Document Understanding Verifiable Reasoning Benchmark Multimodal LLM
摘要

本文提出 DocScope 基准,将长文档问答重构为结构化推理轨迹预测问题,要求模型输出证据页、支持区域、事实陈述及最终答案。通过四阶段评估协议独立审计各推理环节。实验表明,答案准确率无法替代轨迹级评估,即使答案正确,完整证据链比例仅 29%。研究指出跨区域证据聚合是主要难点,忠实感知与事实提取是关键瓶颈,且激活参数量比总规模更重要。

AI 推荐理由

论文核心聚焦于长文档理解中的可验证推理轨迹,评估模型证据链构建与逻辑推导能力。

研究机构
School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China Alibaba Group, Hangzhou, China
论文信息
作者 Xiang Feng, Jiawei Zhou, Zhangfeng Huang, Kewei Wang, Shanshan Ye et al.
发布日期 2026-05-09
arXiv ID 2605.08888
相关性评分 9/10 (高度相关)