摘要
本文研究了自策略蒸馏中教师模型的更新调度对训练稳定性的影响。研究发现,完全的“隔离期”而非教师年龄是实现稳定学习的关键。针对长程训练中因时钟驱动刷新导致的“状态无关崩溃”问题,提出了“巩固门控教师刷新”(CGTR)方法。该方法仅在奖励提升且安全时更新教师,确保每次更新反映学生的真实巩固。实验表明,CGTR 在多个任务上实现了零崩溃并取得最佳成绩。
AI 推荐理由
论文核心研究自策略蒸馏中的教师更新机制,解决自我进化过程中的稳定性与崩溃问题。
研究机构
北京大学
中国科学院大学
清华大学
论文信息