摘要
在科学推理任务中,推理过程的真实性与最终结果同等重要。针对过程奖励模型(PRM)依赖昂贵专家标注的问题,本文提出双重共识弱到强(DC-W2S)框架。该方法利用大量噪声“弱”监督数据,通过结合弱监督者间的自一致性与嵌入空间的邻域一致性,分层筛选高可靠性信号。辅以课程式平衡采样和标签感知掩码策略,成功训练出鲁棒的 PRM。研究表明,战略性数据策展优于在大规模噪声数据上的 indiscriminate 训练,无需 exhaustive 专家注释即可实现复杂推理。
AI 推荐理由
论文聚焦生物推理任务中的过程奖励建模,旨在提升推理过程的可靠性,属核心研究。
研究机构
中国科学院
论文信息