摘要
测试时强化学习(TTRL)通过多数投票共识推导伪奖励,提升大语言模型在无标签测试流上的推理能力。然而,现有方法仅依赖正伪标签策略,在答案分布高度分散的场景下易受弱共识影响,错误地强化不正确轨迹。本文提出选择性互补强化学习(SCRL)框架以缓解标签噪声放大。SCRL 开发选择性正伪标签机制,通过严格共识标准过滤不可靠多数;同时引入首个负监督机制——熵门控负伪标签,基于生成不确定性剪枝错误轨迹。实验表明,SCRL 在多个推理基准上显著优于基线,且在受限 rollout 预算下保持鲁棒泛化性与训练稳定性。
AI 推荐理由
论文核心提出测试时强化学习框架,旨在解决共识噪声问题,显著提升 LLM 推理能力。
研究机构
中国科学院自动化研究所
南京大学
论文信息