摘要
本文研究了测试时扩展技术,即模型在推理阶段通过多轮自我反思提升答案质量。作者提出了上下文策略优化(ICPO)方法,代理利用自评或外部观测奖励在上下文中优化响应而无需修改参数。理论上证明了在特定预训练目标下,单层线性自注意力模型可模拟线性_bandit_的策略优化算法。基于此,提出最小熵 ICPO(ME-ICPO),通过迭代利用响应及其自评奖励 refine 上下文响应,并借助多数投票确保鲁棒性。实验表明该方法在数学推理任务中表现优异且成本可控。
AI 推荐理由
论文核心研究测试时通过多轮自我反思和奖励优化实现自我改进,属于典型的自我进化机制。
研究机构
Brigham Young University
University of North Carolina at Chapel Hill
Microsoft
论文信息