摘要
针对现有策略蒸馏受限于单教师能力上限及代理任务中误差累积问题,本文提出 MAD-OPD 方法。该方法将蒸馏教师重构为进行辩论的教师集体,通过涌现的集体智能提供令牌级监督。此外,引入策略代理蒸馏(OPAD)及任务自适应散度原则,以稳定多步训练并适配不同任务。实验表明,该方法在多种配置及基准测试中均优于传统单教师策略蒸馏,显著提升了代理与代码生成性能。
AI 推荐理由
提出多智能体辩论驱动的策略蒸馏,突破单教师能力上限,实现模型自我改进与进化。
研究机构
School of Artificial Intelligence and Automation, Huazhong University of Science and Technology
论文信息