Test-Time Reinforcement Learning Math Reasoning Spurious Signal Debiasing
摘要

测试时强化学习(TTRL)通过伪标签在推理阶段适应模型,但易受标签噪声产生的伪优化信号影响。研究发现,中等一致性的响应构成模糊区域,是奖励噪声的主要来源,且此类伪信号会通过群组相对优势估计被放大。为此,作者提出去偏去噪测试时强化学习(DDRL)框架:首先采用基于频率的采样策略排除模糊样本;其次利用固定优势进行去偏优势估计;最后引入基于共识的离策略精炼阶段。实验表明,DDRL 在多个数学推理基准上均优于现有 TTRL 基线。

AI 推荐理由

论文核心针对数学推理任务,提出测试时强化学习框架以解决伪信号放大问题,显著提升推理性能。

研究机构
NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences School of Artificial Intelligence, University of Chinese Academy of Sciences Meituan University of Science and Technology of China
论文信息
作者 Yongcan Yu, Lingxiao He, Jian Liang, Kuangpu Guo, Meng Wang et al.
发布日期 2026-04-23
arXiv ID 2604.21327
相关性评分 9/10 (高度相关)