摘要
近期研究致力于利用过程奖励模型(PRM)验证思维链(CoT)的中间推理步骤。然而,训练 PRM 通常依赖昂贵且耗时的人工标注,而现有的蒙特卡洛估计等自动化方法则计算资源消耗巨大。为此,本文提出对比点互信息(CPMI),一种新型自动奖励标注方法。该方法利用模型内部概率推断步骤级监督信号,通过量化推理步骤相对于硬负样本对正确答案互信息的增益,作为步骤贡献的代理指标。实验表明,相比蒙特卡洛估计,CPMI 将数据集构建时间减少 84%,令牌生成量减少 98%,同时在过程级评估和数学推理基准上实现了更高的准确率。
AI 推荐理由
论文核心研究思维链推理步骤的验证与奖励建模,直接提升推理能力。
研究机构
首尔国立大学电气与计算机工程学院
韩国科学技术院计算机科学与工程学院
论文信息