摘要
最先进的推理模型利用长思维链(CoT)解决日益复杂的问题。本文探索了一种长 CoT 设定,允许模型在收到硬验证反馈后,基于先前的尝试进行多达 K 次的连续求解。为此,我们研究了优化 Verification@K 奖励的方法,并指出简单按通过/失败加权会导致梯度偏差。我们提出了校准尝试级 GRPO(CAL-GRPO),通过设计加权策略在保持低方差的同时获得无偏梯度。理论分析与实验表明,该方法在合成及真实数据上均优于传统 GRPO 及朴素加权方法。
AI 推荐理由
论文核心研究多尝试思维链(CoT)下的强化学习校准,直接提升复杂问题的推理能力。
研究机构
University of Michigan, Ann Arbor
论文信息