摘要
当前,过程奖励模型(PRM)在测试时扩展方面展现出巨大潜力。然而,现有基准主要关注数学推理,无法全面评估 PRM 在多样化场景下的过程级错误检测能力。为此,本文引入 GR-Ben,这是一个专为科学和逻辑两大领域及其九个子领域设计的进程级基准。通过对 22 个模型的广泛实验发现:在非数学领域,现有模型的错误检测能力显著较弱;PRM 难以识别基于知识的错误,而 LLM 则在检测计算错误方面表现不佳。该研究旨在推动通用领域 PRM 的发展,从而增强 LLM 的推理能力。
AI 推荐理由
论文提出通用推理基准以评估过程奖励模型,核心聚焦于提升和评估 LLM 的推理错误检测能力。
研究机构
Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology, China
论文信息