RLVR 数据选择 推理增强 互信息
摘要

强化学习(RL)对提升大语言模型的推理与对齐至关重要,但其效率取决于数据选择策略。现有方法多依赖基于难度的启发式规则,忽视了证据不足导致的认知不确定性。本文提出 InSight,一种基于加权互信息目标的数据采样方法。该方法通过贝叶斯潜变量建模,将预期不确定性分解为难度和证据依赖分量,构建了基于成功信念均值的稳定采集分数。实验表明,InSight 在规划与数学基准上平均提升 1.41 分,通用推理提升 1.01 分,并实现约 2.2 倍加速。

AI 推荐理由

论文核心是通过优化 RL 数据选择来提升 LLM 的推理能力,并在数学和规划基准上验证。

研究机构
HKUST(GZ) · UCL · Kuaishou Technology
论文信息
作者 Xinyu Zhou, Boyu Zhu, Haotian Zhang, Huiming Wang, Zhijiang Guo
发布日期 2026-03-02
arXiv ID 2603.01907
相关性评分 9/10 (高度相关)