摘要
现有数学推理基准缺乏基于真实人类表现的单题难度信号。本文推出 KCSAT-ML,包含十年韩国高考数学题及官方错误率数据,并提出“难度对齐推理增益”(DRG)指标,用于分析模型错误是否集中于人类认为困难的题目。实验揭示多模态及大语言模型在不同难度题目上的准确率崩溃、测试时缩放效应非单调性及对齐失败等现象,揭示了聚合准确率所掩盖的模型行为差异。
AI 推荐理由
论文核心研究数学推理基准与模型在人类难度分布上的表现对齐,直接评估推理能力。
研究机构
NAVER Cloud AI
KAIST AI
论文信息