摘要
针对可验证奖励强化学习(RLVR)在噪声标签下训练推理模型的脆弱性,本文系统分析了噪声机制。研究区分了降低数据效率的“非活跃噪声”与导致分布偏移的“活跃噪声”,并发现“早期正确性一致性”现象。据此提出在线标签细化(OLR)方法,利用多数投票和滚动通过率动态修正噪声标签。实验表明,在不同噪声比例下,OLR 显著提升了模型在分布内数学推理及分布外任务上的鲁棒性与准确率。
AI 推荐理由
论文核心研究噪声监督下 LLM 数学推理能力的鲁棒性训练机制,直接提升推理性能。
研究机构
浙江大学
Ant Group
University of Wisconsin-Madison
论文信息