Test-Time Reinforcement Learning Reasoning Enhancement Pseudo-Labeling Label Noise Mitigation
摘要

测试时强化学习(TTRL)通过多数投票共识推导伪奖励,提升大语言模型在无标签测试流上的推理能力。然而,现有方法仅依赖正伪标签策略,在答案分布高度分散的场景下易受弱共识影响,错误地强化不正确轨迹。本文提出选择性互补强化学习(SCRL)框架以缓解标签噪声放大。SCRL 开发选择性正伪标签机制,通过严格共识标准过滤不可靠多数;同时引入首个负监督机制——熵门控负伪标签,基于生成不确定性剪枝错误轨迹。实验表明,SCRL 在多个推理基准上显著优于基线,且在受限 rollout 预算下保持鲁棒泛化性与训练稳定性。

AI 推荐理由

论文核心提出测试时强化学习框架,旨在解决共识噪声问题,显著提升 LLM 推理能力。

研究机构
中国科学院自动化研究所 南京大学
论文信息
作者 Dong Yan, Jian Liang, Yanbo Wang, Shuo Lu, Ran He et al.
发布日期 2026-03-20
arXiv ID 2603.19880
相关性评分 9/10 (高度相关)