Process Reward Models Reinforcement Learning Reasoning Optimization
摘要

过程奖励模型(PRM)虽能提供细粒度推理信号,但训练成本高且存在训推不一致问题,导致令牌级信用分配不可靠。本文提出隐式前缀值奖励模型(IPVRM),通过学习前缀条件价值函数并利用时序差分推导步级信号,显著提升了步骤验证精度。在此基础上,进一步提出分布级强化学习(DistRL),利用校准后的前缀值计算密集反事实更新,无需额外 rollout 即可持续改善下游推理性能。

AI 推荐理由

论文核心解决推理过程中的细粒度奖励建模问题,直接提升逻辑推理能力。

研究机构
Sun Yat-sen University Meta AI University of California, Davis
论文信息
作者 Shiping Gao, Hongzhan Chen, Xiaojun Quan, Qifan Wang, Lifu Huang
发布日期 2026-04-14
arXiv ID 2604.13197
相关性评分 9/10 (高度相关)