摘要
大型语言模型推动了表格问答的发展,但多数查询仅需信息提取或简单聚合。针对现实世界中需要从历史模式推断未观测答案的隐式预测类查询,本文提出了 TopBench 基准。该基准包含 779 个样本,涵盖单点预测、决策制定、治疗效应分析及复杂过滤等子任务,要求模型生成推理文本及结构化表格。实验表明,当前模型常难以识别潜在意图而退化为简单查找;准确的意图消歧是实现有效预测推理的前提,提升预测精度需集成更复杂的建模或推理能力。
AI 推荐理由
论文核心评估 LLM 在表格问答中的隐式预测与逻辑推理能力,聚焦意图识别与推导。
研究机构
School of Artificial Intelligence, Nanjing University, China
National Key Laboratory for Novel Software Technology, Nanjing University, China
论文信息