摘要
可验证奖励的强化学习(RLVR)提升了大语言模型在数学和编程任务中的推理能力,但标准方法往往抑制多次尝试间的响应多样性。本文提出 UpSkill,一种训练时方法,将互信息技能学习(MISL)适配于大语言模型以优化 pass@k 准确率。我们在组相对策略优化(GRPO)框架内引入了一种新颖的令牌级互信息奖励,鼓励轨迹特异性。在 GSM8K 数据集上的实验表明,UpSkill 在不降低单次准确率的前提下,显著提升了强基座模型的多尝试表现。
AI 推荐理由
论文核心针对数学推理任务,通过提升响应多样性优化多尝试准确率(pass@k),直接增强推理能力。
研究机构
普林斯顿大学
论文信息