摘要
针对大推理模型的可验证奖励强化学习(RLVR),现有方法如 PPO 和 GRPO 在基线估计时计算成本高昂。本文提出 POISE 方法,利用策略模型前向传播中已计算的内部信号(隐藏状态及熵统计量),通过轻量级探针预测期望奖励作为基线。该方法引入跨轨迹构建以保持梯度无偏,仅需单次滚动即可估计价值,显著降低方差并提升训练效率。在数学推理基准测试中,POISE 以更少计算量达到了与先进方法相当的性能。
AI 推荐理由
论文针对大推理模型(LRM)的强化学习优化,直接提升数学等推理任务性能。
研究机构
Graduate School of Data Science, Seoul National University
论文信息