numerical reasoning number sense benchmark shortcut learning LLM evaluation
摘要

大语言模型常默认逐步计算,即便存在高效数值捷径。本文提出 SenseMath 基准,评估模型是否具备类人数感,即识别数值结构、适时应用捷径的能力。该基准涵盖八类捷径与四种数量级,支持捷径使用、适用性判断及问题生成三种评估设置。实验显示,虽经提示模型能应用捷径提升准确率,但在标准思维链下自发使用率低,且常过度泛化或无法生成有效问题,表明其缺乏对捷径原理的结构性理解。

AI 推荐理由

论文核心评估 LLM 的数值推理能力,特别是数感、捷径识别与逻辑判断机制。

研究机构
University of Notre Dame
论文信息
作者 Haomin Zhuang, Xiangqi Wang, Yili Shen, Ying Cheng, Xiangliang Zhang
发布日期 2026-04-02
arXiv ID 2604.01988
相关性评分 9/10 (高度相关)