mathematical reasoning model reliability evaluation metrics silent failures
摘要

尽管数学推理模型存在根本性的计算不稳定性,仍被广泛部署。研究表明,最先进模型(如 Qwen2.5-Math-7B)的 61% 准确率混合了可靠与不可靠的推理路径:仅 18.4% 的正确预测源于稳定推理,而 81.6% 来自计算不一致的路径。此外,8.8% 的预测为“静默失败”。分析揭示推理质量与正确性呈弱负相关,参数量扩展未带来显著收益,且潜在推理策略多样。结果强调基准准确率可能掩盖计算不可靠性,呼吁改革评估方法。

AI 推荐理由

论文核心研究数学推理中的稳定性与准确性悖论,深入分析潜在推理路径。

研究机构
独立 AWS Generative AI Innovation Center, Amazon Web Services Meta AI 斯坦福大学
论文信息
作者 Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary
发布日期 2026-03-03
arXiv ID 2603.03475
相关性评分 9/10 (高度相关)