Test-Time Reinforcement Learning Self-Evolution Tool Verification Mode Collapse Reasoning Models
摘要

测试时强化学习(TTRL)已成为大型推理模型自我进化的前沿范式,但其依赖的多数投票机制易受高频错误共识误导,导致模式坍塌。本文提出 T^3RL 方法,引入测试时工具验证机制优化奖励估计。该方法利用外部工具(如代码执行)作为证据,在感知验证的投票中提升已验证轨迹的权重,从而生成更可靠的伪标签用于训练。实验表明,T^3RL 在多种数学基准及架构上显著优于 TTRL,尤其在难题上增益明显,确立了工具验证作为稳定自我进化关键机制的地位。

AI 推荐理由

论文核心解决测试时强化学习中的自我进化稳定性问题,提出工具验证机制防止模式坍塌。

研究机构
中国科学院
论文信息
作者 Ruotong Liao, Nikolai Röhrich, Xiaohan Wang, Yuhui Zhang, Yasaman Samadzadeh et al.
发布日期 2026-03-02
arXiv ID 2603.02203
相关性评分 9/10 (高度相关)