mathematical reasoning dynamic benchmark self-play LLM evaluation
摘要

针对现有静态数学基准测试因性能饱和而难以区分前沿模型能力的问题,本文提出 MathDuels,一种自我博弈基准。在该框架中,模型兼具出题者与解题者双重角色,通过三阶段生成流程构建对抗性数学问题,并利用独立验证器剔除无效题目。研究采用 Rasch 模型联合估算解题能力与问题难度,发现出题与解题能力部分解耦。实验表明,该基准能随模型进化动态提升难度,有效揭示单一角色评估中不可见的能力差异。

AI 推荐理由

论文核心在于评估和提升 LLM 的数学推理能力,通过对抗性出题与解题动态衡量推理水平。

研究机构
Department of Computer and Information Science, University of Pennsylvania Department of Mathematics, University of Pennsylvania
论文信息
作者 Zhiqiu Xu, Shibo Jin, Shreya Arya, Mayur Naik
发布日期 2026-04-23
arXiv ID 2604.21916
相关性评分 9/10 (高度相关)