Process Reward Model Scientific Reasoning Tool Usage Reinforcement Learning
摘要

尽管过程奖励模型(PRM)在数学推理中成效显著,但在生物、化学和物理等复杂科学领域的应用尚属空白。科学问题不仅要求逻辑严谨,还需事实一致性及领域特定工具的精确使用,而现有模型常受幻觉困扰且缺乏验证机制。本文构建了包含“工具链”轨迹的大规模数据集 SCIPRM70K,明确交织推理与科学工具执行。基于此,训练了高效奖励模型 Sci-PRM,对推理每一步的工具选择、执行准确度及结果解释提供细粒度监督。实验表明,Sci-PRM 通过最佳 N 选策略有效实现测试时扩展,并在强化学习中作为密集奖励信号缓解优势消失问题,突破现有性能瓶颈。

AI 推荐理由

论文聚焦科学推理验证,构建工具感知过程奖励模型,核心提升推理准确性。

研究机构
上海交通大学 香港科技大学 新加坡国立大学
论文信息
作者 Xiangyu Zhao, Hengyuan Zhao, Yiheng Wang, Wanghan Xu, Yuhao Zhou et al.
发布日期 2026-06-03
arXiv ID 2606.04579
相关性评分 9/10 (高度相关)