Reinforcement Learning Chain of Thought Credit Assignment LLM Alignment
摘要

强化学习对于对齐大语言模型以执行复杂推理任务至关重要。然而,现有算法(如组相对策略优化)受限于粗粒度的序列级信用分配,难以在长链思维生成中隔离关键推理步骤。此外,标准的无界 KL 散度惩罚导致严重的梯度不稳定和模式寻求保守性,阻碍了新推理轨迹的发现。为此,我们提出了分布引导策略优化(DGPO),这是一种无需评论家的新型强化学习框架,它将分布偏差重新解释为引导信号而非刚性惩罚,从而有效解决上述局限。

AI 推荐理由

论文针对长链思维推理中的细粒度信用分配问题,提出新强化学习框架以优化推理轨迹。

研究机构
北京大学 清华大学
论文信息
作者 Hongbo Jin, Rongpeng Zhu, Zhongjing Du, Xu Jiang, Jingqi Tian et al.
发布日期 2026-05-05
arXiv ID 2605.03327
相关性评分 9/10 (高度相关)