Table QA Implicit Reasoning Benchmark Predictive Analysis
摘要

大型语言模型推动了表格问答的发展,但多数查询仅需信息提取或简单聚合。针对现实世界中需要从历史模式推断未观测答案的隐式预测类查询,本文提出了 TopBench 基准。该基准包含 779 个样本,涵盖单点预测、决策制定、治疗效应分析及复杂过滤等子任务,要求模型生成推理文本及结构化表格。实验表明,当前模型常难以识别潜在意图而退化为简单查找;准确的意图消歧是实现有效预测推理的前提,提升预测精度需集成更复杂的建模或推理能力。

AI 推荐理由

论文核心评估 LLM 在表格问答中的隐式预测与逻辑推理能力,聚焦意图识别与推导。

研究机构
School of Artificial Intelligence, Nanjing University, China National Key Laboratory for Novel Software Technology, Nanjing University, China
论文信息
作者 An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan, Han-Jia Ye
发布日期 2026-04-30
arXiv ID 2604.28076
相关性评分 9/10 (高度相关)