Multimodal LLM Semantic Reasoning Document Reconstruction Benchmark
摘要

多模态大语言模型在视觉丰富文档理解任务中表现优异,但现有评估多基于完整文档。本文提出 ShredBench 基准,专注于从碎片化片段恢复内容的挑战性场景,要求模型结合视觉模式识别与语义推理以克服内容断裂。该基准支持四种场景及三种碎片粒度,通过自动化流水线生成数据以防污染。实验表明,当前模型在处理碎片文档时性能显著下降,缺乏跨越视觉断点的细粒度跨模态推理能力,揭示了该领域的关键差距。

AI 推荐理由

论文核心评估多模态模型在文档碎片重组中的语义推理能力,直接聚焦推理机制。

研究机构
西安交通大学 阿里巴巴集团 上海交通大学 Old Dominion University
论文信息
作者 Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin et al.
发布日期 2026-04-26
arXiv ID 2604.23813
相关性评分 9/10 (高度相关)