Multi-hop QA Table-Text Reasoning Benchmark Construction
摘要

现实世界的表格 - 文本问答任务要求模型能在长文本和源表间进行推理,执行多跳遍历及聚合等复杂操作。现有基准规模小、人工 curated 易错且问题浅显。本文提出 SPARTA,一个端到端构建框架,可自动生成大规模基准。该框架通过 enrich 源表构建参考事实库,并合成嵌套查询以匹配所需跳数。为确保 SQL 可执行及问题自然,提出了基于出处的 refinement 和现实结构强制两项新技术。实验表明,当前 SOTA 模型在该基准上表现大幅下降,暴露了跨模态推理的根本弱点。

AI 推荐理由

论文核心在于构建评估多跳推理与复杂聚合操作的基准,直接针对跨模态推理能力。

研究机构
POSTECH,韩国浦项
论文信息
作者 Sungho Park, Jueun Kim, Wook-Shin Han
发布日期 2026-02-26
arXiv ID 2602.23286
相关性评分 9/10 (高度相关)