摘要
大型语言模型在竞技编程等复杂推理任务中表现优异,但现有方法多关注单次尝试,忽视了迭代修正潜力。本文提出 RefineRL,旨在释放大模型的自我修正能力。该方法包含两大创新:一是“怀疑智能体”,配备本地执行工具验证解法,即使验证通过也保持怀疑态度以强制严谨修正;二是基于标准可验证数据的强化学习方案,激励模型进行自我修正。实验表明,经训练的 4B 模型结合该智能体,性能超越更大的 32B 模型,并接近 235B 模型的单次尝试表现,证明自我修正在扩展推理能力方面的巨大潜力。
AI 推荐理由
论文核心提出自我修正强化学习方法,通过迭代自优化提升模型能力,属自我进化范畴。
研究机构
Microsoft Research
论文信息