mathematical reasoning benchmark evaluation statistical analysis LLM limitations
摘要

GSM-Symbolic 基准曾报告大型语言模型在变体问题上性能一致下降,据此断言模型缺乏真正的推理能力。本文指出该结论统计基础薄弱。通过广义线性混合模型重估 20 个开源模型,发现仅半数在原提示下表现出显著性能变化。研究揭示原数据集存在大整数分布系统性偏移,控制此因素后解释了约半数剩余显著案例。针对仍有显著差异的模型,识别出变量绑定脆弱、算术限制等特定失败模式,表明对 LLM 推理能力的笼统否定为时过早且具误导性。

AI 推荐理由

论文核心在于重新评估 LLM 在数学推理基准上的表现,深入分析统计显著性与失败机制。

研究机构
Instituto Superior Técnico & INESC-ID, Universidade de Lisboa, Portugal Dept. of Computer Science and AI & DaSCI Institute, Universidad de Granada, Spain
论文信息
作者 Dominika Agnieszka Długosz, Arlindo Oliveira, Natalia Díaz Rodríguez
发布日期 2026-05-27
arXiv ID 2605.28700
相关性评分 9/10 (高度相关)