摘要
尽管数学推理模型存在根本性的计算不稳定性,仍被广泛部署。研究表明,最先进模型(如 Qwen2.5-Math-7B)的 61% 准确率混合了可靠与不可靠的推理路径:仅 18.4% 的正确预测源于稳定推理,而 81.6% 来自计算不一致的路径。此外,8.8% 的预测为“静默失败”。分析揭示推理质量与正确性呈弱负相关,参数量扩展未带来显著收益,且潜在推理策略多样。结果强调基准准确率可能掩盖计算不可靠性,呼吁改革评估方法。
AI 推荐理由
论文核心研究数学推理中的稳定性与准确性悖论,深入分析潜在推理路径。
研究机构
独立
AWS Generative AI Innovation Center, Amazon Web Services
Meta AI
斯坦福大学
论文信息