摘要
大型语言模型擅长复杂推理,但评估其中间步骤仍具挑战。现有过程奖励模型常受风险补偿效应影响,即错误步骤被后续正确步骤抵消,导致有缺陷的推理路径获得高奖励。这在存在多路径的知识图谱推理中尤为严重。为此,本文提出模式感知累积过程奖励模型(SCPRM),通过条件化推理前缀并融入当前步骤与隐式目标的模式距离,提供累积及未来奖励以指导路径探索。进一步将 SCPRM 集成至蒙特卡洛树搜索中,在医疗、法律等风险敏感任务中显著提升了推理评估的准确性。
AI 推荐理由
论文核心提出过程奖励模型以评估和优化知识图谱推理路径,解决风险补偿问题。
研究机构
HKUST (GZ)
论文信息