Mathematical Reasoning Evaluation Framework Strategy Diversity LLM Assessment
摘要

大语言模型在数学推理基准测试中虽已达到高准确率,但单一指标无法反映推理灵活性。本文提出一种策略级评估框架,基于 80 道 AMC/AIME 试题及 217 种人类参考策略族,对模型输出的策略身份、有效性和正确性进行标注。研究发现,四款前沿模型在单解提示下准确率极高,但在多策略提示下恢复的策略数量显著少于人类参考集,且存在几何与数论领域的差距。结果表明,策略多样性是评估数学推理能力的重要补充维度。

AI 推荐理由

论文核心研究 LLM 数学推理中的策略多样性评估,直接针对推理能力的深度分析。

研究机构
University of Toronto Upper Canada College East China Normal University
论文信息
作者 Xia Yang, Xuanyi Zhang, Hao Hu, Feng Ji
发布日期 2026-05-10
arXiv ID 2605.09292
相关性评分 9/10 (高度相关)