摘要
现实世界的表格 - 文本问答任务要求模型能在长文本和源表间进行推理,执行多跳遍历及聚合等复杂操作。现有基准规模小、人工 curated 易错且问题浅显。本文提出 SPARTA,一个端到端构建框架,可自动生成大规模基准。该框架通过 enrich 源表构建参考事实库,并合成嵌套查询以匹配所需跳数。为确保 SQL 可执行及问题自然,提出了基于出处的 refinement 和现实结构强制两项新技术。实验表明,当前 SOTA 模型在该基准上表现大幅下降,暴露了跨模态推理的根本弱点。
AI 推荐理由
论文核心在于构建评估多跳推理与复杂聚合操作的基准,直接针对跨模态推理能力。
研究机构
POSTECH,韩国浦项
论文信息