Long-Horizon Reasoning Policy Distillation Efficiency LLM Training
摘要

在线策略蒸馏(OPD)利用密集教师奖励增强推理模型,但在长程任务中,学生生成前缀偏离教师思路会导致奖励失效及计算浪费。本文提出 Prune-OPD 框架,通过实时监控师生预测兼容性检测前缀漂移,动态截断无效生成并重分配计算资源至可靠监督。该方法在保持甚至提升 AMC、AIME 等基准性能的同时,显著减少训练时间,实现了计算预算与监督质量的动态对齐。

AI 推荐理由

论文核心解决长程推理中的策略蒸馏效率问题,直接提升推理能力。

研究机构
香港科技大学与科技学院(广州)
论文信息
作者 Zhicheng Yang, Zhijiang Guo, Yifan Song, Minrui Xu, Yongxin Wang et al.
发布日期 2026-05-08
arXiv ID 2605.07804
相关性评分 9/10 (高度相关)