摘要
可验证奖励强化学习(RLVR)显著推动了大语言模型推理的发展,但面临标注成本高与无监督方法模型崩溃的两难困境。现有半监督方法虽利用少量标签引导未标注数据,却因依赖粗糙的性能启发式而受限于数据效率瓶颈。为此,本文提出 GeoMin,通过在标签数据上建模全局特征分布,解码正确与错误轨迹间的结构差异,从而建立稳健先验以评估自奖励信号的可靠性,充分释放未标注数据潜力。实验表明,GeoMin 仅用 10% 标注量即超越全监督模型,展现出卓越的数据效率。
AI 推荐理由
论文核心旨在通过半监督 RLVR 提升 LLM 推理能力,解决数据效率瓶颈。
研究机构
Zhejiang University
Ant Group
论文信息