摘要
测试时强化学习(TTRL)通过伪标签在推理阶段适应模型,但易受标签噪声产生的伪优化信号影响。研究发现,中等一致性的响应构成模糊区域,是奖励噪声的主要来源,且此类伪信号会通过群组相对优势估计被放大。为此,作者提出去偏去噪测试时强化学习(DDRL)框架:首先采用基于频率的采样策略排除模糊样本;其次利用固定优势进行去偏优势估计;最后引入基于共识的离策略精炼阶段。实验表明,DDRL 在多个数学推理基准上均优于现有 TTRL 基线。
AI 推荐理由
论文核心针对数学推理任务,提出测试时强化学习框架以解决伪信号放大问题,显著提升推理性能。
研究机构
NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences
School of Artificial Intelligence, University of Chinese Academy of Sciences
Meituan
University of Science and Technology of China
论文信息