摘要
可验证奖励强化学习(RLVR)是增强大语言模型推理能力的关键技术,但其数据效率低下仍是主要瓶颈。现有方法在子集覆盖、验证信号利用或可解释性方面存在缺失。为此,本文提出 IRDS,基于稀疏自编码器(SAE)聚类选择训练实例,确保选择过程针对可识别的问题模式且可审计。通过引入验证器耦合的覆盖目标并采用贪婪对数行列式最大化求解,筛选出模型既失败又能从中学习的实例。实验表明,IRDS 在多个数学推理基准上取得了最高准确率,显著优于基线方法,同时计算成本降低一个数量级。
AI 推荐理由
论文核心旨在通过数据选择优化 RLVR,直接提升 LLM 在数学基准上的推理能力。
研究机构
The Hong Kong University of Science and Technology (Guangzhou)
Nanjing University of Aeronautics and Astronautics
The 63rd Research Institute, National University of Defense Technology, Nanjing
论文信息