摘要
过程奖励模型(PRM)依赖高质量的过程监督数据,但现有方法在错误位置、类型及轨迹一致性上控制有限。本文提出一种可控且可验证的合成框架:首先生成正确的符号推理链,在中间步骤注入模板感知错误,基于受损状态重算后续步骤,并验证该错误步无法从前缀推导。生成的配对轨迹在首个错误处前缀无效,但在符号重算后保持轨迹一致,并转化为对齐的自然语言过程用于 PRM 训练。实验表明,该方法提升了逻辑推理基准上的最佳重排序效果,并迁移至数学推理任务。
AI 推荐理由
论文核心在于通过合成可控的过程监督数据,提升大模型在逻辑与数学推理中的过程奖励模型性能。
研究机构
Jilin University
论文信息