Process Reward Modeling Weak-to-Strong Generalization Scientific Reasoning Data Curation
摘要

在科学推理任务中,推理过程的真实性与最终结果同等重要。针对过程奖励模型(PRM)依赖昂贵专家标注的问题,本文提出双重共识弱到强(DC-W2S)框架。该方法利用大量噪声“弱”监督数据,通过结合弱监督者间的自一致性与嵌入空间的邻域一致性,分层筛选高可靠性信号。辅以课程式平衡采样和标签感知掩码策略,成功训练出鲁棒的 PRM。研究表明,战略性数据策展优于在大规模噪声数据上的 indiscriminate 训练,无需 exhaustive 专家注释即可实现复杂推理。

AI 推荐理由

论文聚焦生物推理任务中的过程奖励建模,旨在提升推理过程的可靠性,属核心研究。

研究机构
中国科学院
论文信息
作者 Chi-Min Chan, Ehsan Hajiramezanali, Xiner Li, Edward De Brouwer, Carl Edwards et al.
发布日期 2026-03-09
arXiv ID 2603.08095
相关性评分 9/10 (高度相关)