摘要
多模态大语言模型在视觉丰富文档理解任务中表现优异,但现有评估多基于完整文档。本文提出 ShredBench 基准,专注于从碎片化片段恢复内容的挑战性场景,要求模型结合视觉模式识别与语义推理以克服内容断裂。该基准支持四种场景及三种碎片粒度,通过自动化流水线生成数据以防污染。实验表明,当前模型在处理碎片文档时性能显著下降,缺乏跨越视觉断点的细粒度跨模态推理能力,揭示了该领域的关键差距。
AI 推荐理由
论文核心评估多模态模型在文档碎片重组中的语义推理能力,直接聚焦推理机制。
研究机构
西安交通大学
阿里巴巴集团
上海交通大学
Old Dominion University
论文信息