摘要
推理模型发展迅速,但主流的可验证奖励强化学习(RLVR)仅利用二元正确性反馈,忽略了执行轨迹等丰富信息。本文提出一种基于经典模仿学习算法 DAgger 的分布式变体,利用专家分布处理丰富反馈。该方法通过前向交叉熵目标,将未来专家与学生的分歧反向传播至早期决策,实现序列级信用分配。理论证明该方法能保证策略单调改进并优化成功概率下界。实验表明,DistIL 在科学推理、编程及复杂数学问题求解上均优于现有基线。
AI 推荐理由
论文针对推理模型,利用丰富反馈提升科学、代码及数学推理能力,核心贡献显著。
研究机构
University of Southern California
论文信息