Reinforcement Learning Chain-of-Thought Reward Redistribution Reasoning Models
摘要

近期推理语言模型的进步主要由强化学习微调驱动,常依赖 GRPO 算法引导模型生成思维链。然而,仅在思维链完成后验证答案并分配奖励,导致延迟奖励问题及高方差。本文提出 RREDCoT,利用模型自身近似最优奖励重分配,无需额外生成即可对关键思维片段进行信用赋值。研究对比了该方法与蒙特卡洛采样及多种归因方法的优势,并分析了思维链分割与状态值估计等构建要素。

AI 推荐理由

论文核心针对推理模型中的思维链奖励分配问题,提出新机制以提升推理能力。

研究机构
ELIS Uni Linz and LIT AI Lab, Institute for Machine Learning, Johannes Kepler University Linz, Austria Cognizant AI Lab, San Francisco, USA NNAI GmbH, Linz, Austria
论文信息
作者 Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger, Sepp Hochreiter
发布日期 2026-06-04
arXiv ID 2606.06475
相关性评分 9/10 (高度相关)