摘要
推理前缀塑造了大语言模型解决问题的未来轨迹,但现有过程奖励模型通常仅通过局部步骤的正确性进行评估。本文认为,正确性只是间接代理,我们真正关心的是前缀是否提高了成功完成的概率。我们将此效应定义为“前缀增益”,即条件化轻量级学生模型组于某前缀后求解率的提升,并据此训练具有简单成对排序目标的前缀效用模型(PUM)。PUM 学习基于结果的前缀效用,可对完整轨迹和部分推理前缀评分。在数学推理的最佳 N 选、束搜索及强化学习中,PUM 提供了强有力的前缀级监督信号。
AI 推荐理由
论文提出基于效用的前缀评估模型,直接优化数学推理中的搜索与完成概率,属核心研究。
研究机构
复旦大学
上海人工智能研究院
论文信息