RLVR 数据效率 元认知 不确定性估计 大型推理模型
摘要

可验证奖励的强化学习(RLVR)推动了大型推理模型的发展,但依赖海量标注数据。现有数据高效方法或依赖预标注池,或在无监督下表现欠佳。本文研究“黑暗中挑选”设置,旨在无前馈监督下筛选最具价值的未标注样本。分析表明,智能选择依赖于校准良好的不确定性估计器。据此,作者提出 PivotTrace 框架,利用注意力动态追踪推理过程中的元认知枢轴,通过枢轴密度量化不确定性,实现数据自动路由。实验显示,该方法仅用 29.3% 标注样本即超越全监督模型,且收敛速度快 2.75 倍。

AI 推荐理由

论文核心在于通过元认知枢轴追踪优化推理模型的训练效率,直接提升推理能力。

研究机构
浙江大学 安图集团
论文信息
作者 Guangcheng Zhu, Shenzhi Yang, Haobo Wang, Xing Zheng, Yingfan MA et al.
发布日期 2026-06-03
arXiv ID 2606.04503
相关性评分 9/10 (高度相关)