Diffusion LLM Reinforcement Learning Mathematical Reasoning Policy Optimization
摘要

扩散大语言模型(dLLMs)为并行高效文本生成提供了新途径,但其推理能力的提升受限于缺乏可处理的序列级对数比率,导致现有强化学习方法不稳定。本文提出相对分数策略优化(RSPO),利用可验证奖励校准噪声似然估计。该方法将奖励优势解释为当前策略与参考策略间相对对数比率的目标,通过缩小估计值与目标值的差距来更新策略。实验表明,RSPO 在规划任务上增益显著,并在数学推理任务中表现优异。

AI 推荐理由

论文核心目标是提升扩散语言模型的推理能力,并在数学推理基准上验证了方法的有效性。

研究机构
中国科学技术大学 香港中文大学 香港大学
论文信息
作者 Zichao Yu, Shengze Xu, Bingqing Jiang, Wenyi Zhang, Difan Zou
发布日期 2026-05-11
arXiv ID 2605.10218
相关性评分 9/10 (高度相关)