self-improvement test-time scaling self-reflection in-context learning
摘要

本文研究了测试时扩展技术,即模型在推理阶段通过多轮自我反思提升答案质量。作者提出了上下文策略优化(ICPO)方法,代理利用自评或外部观测奖励在上下文中优化响应而无需修改参数。理论上证明了在特定预训练目标下,单层线性自注意力模型可模拟线性_bandit_的策略优化算法。基于此,提出最小熵 ICPO(ME-ICPO),通过迭代利用响应及其自评奖励 refine 上下文响应,并借助多数投票确保鲁棒性。实验表明该方法在数学推理任务中表现优异且成本可控。

AI 推荐理由

论文核心研究测试时通过多轮自我反思和奖励优化实现自我改进,属于典型的自我进化机制。

研究机构
Brigham Young University University of North Carolina at Chapel Hill Microsoft
论文信息
作者 Tianrun Yu, Yuxiao Yang, Zhaoyang Wang, Kaixiang Zhao, Porter Jenkins et al.
发布日期 2026-03-02
arXiv ID 2603.01335
相关性评分 9/10 (高度相关)