摘要
大语言模型常默认逐步计算,即便存在高效数值捷径。本文提出 SenseMath 基准,评估模型是否具备类人数感,即识别数值结构、适时应用捷径的能力。该基准涵盖八类捷径与四种数量级,支持捷径使用、适用性判断及问题生成三种评估设置。实验显示,虽经提示模型能应用捷径提升准确率,但在标准思维链下自发使用率低,且常过度泛化或无法生成有效问题,表明其缺乏对捷径原理的结构性理解。
AI 推荐理由
论文核心评估 LLM 的数值推理能力,特别是数感、捷径识别与逻辑判断机制。
研究机构
University of Notre Dame
论文信息