摘要
本文探讨了在严格闭环设置下,仅利用模型自身生成监督信号的自进化(SE)能力。研究在统一离线框架中分析了四种策略:单轮验证、多轮反馈修订、迭代训练和课程学习。实验基于骑士与无赖逻辑推理任务,结果显示自进化虽优于基线模型,但存在计算收益递减及与 oracle 监督的显著差距。多轮批评 - 修订策略表现最佳,Gemma 12B 接近 oracle 水平。在真实基准测试中增益有限,表明最小化设定下内部生成监督仍显不足。
AI 推荐理由
论文核心研究闭环设置下 LLM 的自我进化机制、策略及泛化差距。
研究机构
Google Research
Harvard University
Virginia Tech
论文信息