摘要
本文引入了一个广泛的定性时空推理(QSTR)基准,用于评估大语言模型(LLM)。该基准涵盖组合推理、逆关系及概念邻域等任务,涉及点代数、Allen 区间代数、区域连接演算(RCC-5/8/22)等多种演算体系,并首次发布了 RCC-22 的概念邻域表。通过系统变化问题呈现形式,对前沿模型进行了测试。结果显示,虽所有模型表现优于随机猜测,但均无法 consistently 正确回答所有问题,且不同演算体系间性能差异显著。该研究旨在推动 LLM 在定性时空推理领域的进一步评估与发展。
AI 推荐理由
论文核心是构建基准以评估 LLM 在定性时空逻辑上的推理能力,直接针对推理机制。
研究机构
School of Computer Science, The University of Leeds, Woodhouse Lane, Leeds, LS2 9JT, UK
The Alan Turing Institute, British Library, 96 Euston Road, London, NW1 2DB, UK
论文信息