摘要
在线策略蒸馏(OPD)利用密集教师奖励增强推理模型,但在长程任务中,学生生成前缀偏离教师思路会导致奖励失效及计算浪费。本文提出 Prune-OPD 框架,通过实时监控师生预测兼容性检测前缀漂移,动态截断无效生成并重分配计算资源至可靠监督。该方法在保持甚至提升 AMC、AIME 等基准性能的同时,显著减少训练时间,实现了计算预算与监督质量的动态对齐。
AI 推荐理由
论文核心解决长程推理中的策略蒸馏效率问题,直接提升推理能力。
研究机构
香港科技大学与科技学院(广州)
论文信息