摘要
数学推理基准对评估大语言模型至关重要,但现有基准多为静态且易被记忆,难以区分真实推理与背诵。人工构建新问题成本高昂。本文提出 ReverseMath,一种通过答案反转 scalable 生成新数学问题的方法:掩码原题数值,将原答案作为已知条件重写问题,使掩码值成为新答案。该方法既用于评估(揭示模型行为偏移及记忆现象),也用于训练(为强化学习提供自动标注的增强数据)。实验表明,引入该数据显著提升了多基准下的数学推理性能。
AI 推荐理由
论文核心聚焦数学推理基准评估与训练,通过答案反转生成可验证数据以提升推理能力。
研究机构
慕尼黑大学信息与语言处理中心
论文信息