摘要
大语言模型在数学推理基准测试中虽已达到高准确率,但单一指标无法反映推理灵活性。本文提出一种策略级评估框架,基于 80 道 AMC/AIME 试题及 217 种人类参考策略族,对模型输出的策略身份、有效性和正确性进行标注。研究发现,四款前沿模型在单解提示下准确率极高,但在多策略提示下恢复的策略数量显著少于人类参考集,且存在几何与数论领域的差距。结果表明,策略多样性是评估数学推理能力的重要补充维度。
AI 推荐理由
论文核心研究 LLM 数学推理中的策略多样性评估,直接针对推理能力的深度分析。
研究机构
University of Toronto
Upper Canada College
East China Normal University
论文信息