self-improvement contrastive learning reasoning efficiency non-parametric learning
摘要

语言模型可利用可验证奖励提升推理任务表现,但现有参数化与非参数化方法通常需大量样本与 rollout,成本高昂。本文提出对比反思(CORE)算法,通过对比过往推理轨迹生成自然语言洞察,捕捉成功与失败尝试间的策略差异。实验表明,CORE 在四种推理任务中以更少 rollout 实现比基线更快的性能提升,且在极低样本下表现优异,同时具备更高的上下文效率与可解释性,为模型自我进化提供了高效新路径。

AI 推荐理由

论文提出对比反思机制,通过生成洞察实现模型自我改进与快速进化,属核心研究。

研究机构
Stanford University
论文信息
作者 Linas Nasvytis, Simon Jerome Han, Ben Prystawski, Satchel Grant, Noah D. Goodman et al.
发布日期 2026-05-27
arXiv ID 2605.28742
相关性评分 9/10 (高度相关)