摘要
强化学习(RL)对提升大语言模型的推理与对齐至关重要,但其效率取决于数据选择策略。现有方法多依赖基于难度的启发式规则,忽视了证据不足导致的认知不确定性。本文提出 InSight,一种基于加权互信息目标的数据采样方法。该方法通过贝叶斯潜变量建模,将预期不确定性分解为难度和证据依赖分量,构建了基于成功信念均值的稳定采集分数。实验表明,InSight 在规划与数学基准上平均提升 1.41 分,通用推理提升 1.01 分,并实现约 2.2 倍加速。
AI 推荐理由
论文核心是通过优化 RL 数据选择来提升 LLM 的推理能力,并在数学和规划基准上验证。
研究机构
HKUST(GZ) · UCL · Kuaishou Technology
论文信息