摘要
GSM-Symbolic 基准曾报告大型语言模型在变体问题上性能一致下降,据此断言模型缺乏真正的推理能力。本文指出该结论统计基础薄弱。通过广义线性混合模型重估 20 个开源模型,发现仅半数在原提示下表现出显著性能变化。研究揭示原数据集存在大整数分布系统性偏移,控制此因素后解释了约半数剩余显著案例。针对仍有显著差异的模型,识别出变量绑定脆弱、算术限制等特定失败模式,表明对 LLM 推理能力的笼统否定为时过早且具误导性。
AI 推荐理由
论文核心在于重新评估 LLM 在数学推理基准上的表现,深入分析统计显著性与失败机制。
研究机构
Instituto Superior Técnico & INESC-ID, Universidade de Lisboa, Portugal
Dept. of Computer Science and AI & DaSCI Institute, Universidad de Granada, Spain
论文信息