摘要
从视觉文档中提取结构化信息是商业自动化的基石。针对现有基准在规模、真实性及语义粒度上的不足,本文提出了 ReceiptBench,一个包含 1 万张多样化收据的大规模人工标注基准。该基准将信息提取划分为四个层级子任务:基础感知、格式规范化、语义推理及结构解析,重点考察从上下文中推断隐含属性的能力。此外,本文提出了一种结合度量感知组相对策略优化(GRPO)的两阶段训练框架,将评估约束转化为强化学习信号以增强结构一致性。实验表明,该方法在复杂推理任务上超越了领先的专有模型。
AI 推荐理由
论文核心聚焦于多模态模型的语义推理能力,提出分层推理任务及强化学习方法提升复杂推理表现。
研究机构
浙江大学
论文信息