math reasoning benchmark human alignment difficulty calibration
摘要

现有数学推理基准缺乏基于真实人类表现的单题难度信号。本文推出 KCSAT-ML,包含十年韩国高考数学题及官方错误率数据,并提出“难度对齐推理增益”(DRG)指标,用于分析模型错误是否集中于人类认为困难的题目。实验揭示多模态及大语言模型在不同难度题目上的准确率崩溃、测试时缩放效应非单调性及对齐失败等现象,揭示了聚合准确率所掩盖的模型行为差异。

AI 推荐理由

论文核心研究数学推理基准与模型在人类难度分布上的表现对齐,直接评估推理能力。

研究机构
NAVER Cloud AI KAIST AI
论文信息
作者 Sanghee Park, Geewook Kim, Kee-Eung Kim
发布日期 2026-06-09
arXiv ID 2606.10403
相关性评分 9/10 (高度相关)