Math Benchmark Error Analysis LLM Evaluation
摘要

现有数学基准难以扩展且无法跟上大模型发展速度。本文提出一种新的基准生成流程,利用 AI 生成的假设识别大模型易错的特定数学概念与技能,进而生成针对这些弱点的难题。实验表明,假设准确度与生成问题难度正相关:基于最准确假设生成的问题将 Llama-3.3-70B-Instruct 的准确率从原始 MATH 基准的 77% 降至 45%。该流程具有高度适应性,可推广至其他领域以广泛探究大模型能力。

AI 推荐理由

论文核心聚焦于数学推理能力的评估与基准生成,通过错误分析针对性提升推理测试难度。

研究机构
Department of Computer Science, University of Chicago, Chicago, IL 60637, USA
论文信息
作者 Jiayu Fu, Mourad Heddaya, Chenhao Tan
发布日期 2026-04-06
arXiv ID 2604.04386
相关性评分 9/10 (高度相关)