Reinforcement Learning Reasoning Models Imitation Learning Rich Feedback
摘要

推理模型发展迅速,但主流的可验证奖励强化学习(RLVR)仅利用二元正确性反馈,忽略了执行轨迹等丰富信息。本文提出一种基于经典模仿学习算法 DAgger 的分布式变体,利用专家分布处理丰富反馈。该方法通过前向交叉熵目标,将未来专家与学生的分歧反向传播至早期决策,实现序列级信用分配。理论证明该方法能保证策略单调改进并优化成功概率下界。实验表明,DistIL 在科学推理、编程及复杂数学问题求解上均优于现有基线。

AI 推荐理由

论文针对推理模型,利用丰富反馈提升科学、代码及数学推理能力,核心贡献显著。

研究机构
University of Southern California
论文信息
作者 Rishabh Agrawal, Jacob Fein-Ashley, Paria Rashidinejad
发布日期 2026-06-03
arXiv ID 2606.05152
相关性评分 9/10 (高度相关)