摘要
测试时强化学习(TTRL)已成为大型推理模型自我进化的前沿范式,但其依赖的多数投票机制易受高频错误共识误导,导致模式坍塌。本文提出 T^3RL 方法,引入测试时工具验证机制优化奖励估计。该方法利用外部工具(如代码执行)作为证据,在感知验证的投票中提升已验证轨迹的权重,从而生成更可靠的伪标签用于训练。实验表明,T^3RL 在多种数学基准及架构上显著优于 TTRL,尤其在难题上增益明显,确立了工具验证作为稳定自我进化关键机制的地位。
AI 推荐理由
论文核心解决测试时强化学习中的自我进化稳定性问题,提出工具验证机制防止模式坍塌。
研究机构
中国科学院
论文信息