摘要
本文研究了自蒸馏中的上下文设计,通过训练求解器利用冻结评论器的反馈进行自我改进。实验对比了二元奖励、参考解及与推理轨迹对齐的逐步评论三种条件。结果表明,步骤对齐的评论效果最佳,显著优于其他方法。分析发现,该机制仅针对推理失败的 token 进行修正,保留了正确行为;而参考解则迫使模型改变所有 token 的行为。研究证实,反馈与求解器推理之间的结构对齐是自蒸馏有效性的关键驱动力。
AI 推荐理由
论文核心研究利用反馈对齐进行自蒸馏,实现模型自我改进与能力进化。
研究机构
Gensyn
论文信息