Self-Evolution Reasoning Closed-Loop Generalization Gap
摘要

本文探讨了在严格闭环设置下,仅利用模型自身生成监督信号的自进化(SE)能力。研究在统一离线框架中分析了四种策略:单轮验证、多轮反馈修订、迭代训练和课程学习。实验基于骑士与无赖逻辑推理任务,结果显示自进化虽优于基线模型,但存在计算收益递减及与 oracle 监督的显著差距。多轮批评 - 修订策略表现最佳,Gemma 12B 接近 oracle 水平。在真实基准测试中增益有限,表明最小化设定下内部生成监督仍显不足。

AI 推荐理由

论文核心研究闭环设置下 LLM 的自我进化机制、策略及泛化差距。

研究机构
Google Research Harvard University Virginia Tech
论文信息
作者 Zhenting Qi, Susanna Maria Baby, Stefanie Anna Baby, Kan Yuan, Andrew Tomkins et al.
发布日期 2026-05-31
arXiv ID 2606.01075
相关性评分 9/10 (高度相关)