摘要
尽管大语言模型在求解高中数学题上表现优异,但其评估真实学生多样化推理过程的能力尚未经过充分检验。为此,本文提出 RealMath-Eval,这是一个包含 224 份真实高中考试作答的严格标注基准。评估显示,即使是最先进的 LLM 评判者在此任务上也表现不佳,与专家评分相比均方误差较高。对比实验发现存在显著的“评估差距”:模型对合成文本的评估更准确,却难以泛化至真实学生推理。语义嵌入分析表明,人类错误空间更多样,且具有更高的信息论惊奇度,说明当前依赖合成数据的评估流程无法充分捕捉真实数学推理的多样性。
AI 推荐理由
论文核心研究 LLM 对人类真实数学推理过程的评估能力,深入分析推理差异与分布特性。
研究机构
The Chinese University of Hong Kong, Shenzhen
University of Wisconsin-Madison
East China Normal University
New York University
Tongji University
论文信息