摘要
近期推理语言模型的进步主要由强化学习微调驱动,常依赖 GRPO 算法引导模型生成思维链。然而,仅在思维链完成后验证答案并分配奖励,导致延迟奖励问题及高方差。本文提出 RREDCoT,利用模型自身近似最优奖励重分配,无需额外生成即可对关键思维片段进行信用赋值。研究对比了该方法与蒙特卡洛采样及多种归因方法的优势,并分析了思维链分割与状态值估计等构建要素。
AI 推荐理由
论文核心针对推理模型中的思维链奖励分配问题,提出新机制以提升推理能力。
研究机构
ELIS Uni Linz and LIT AI Lab, Institute for Machine Learning, Johannes Kepler University Linz, Austria
Cognizant AI Lab, San Francisco, USA
NNAI GmbH, Linz, Austria
论文信息