Process Reward Model Knowledge Graph QA Risk-sensitive Reasoning MCTS
摘要

大型语言模型擅长复杂推理,但评估其中间步骤仍具挑战。现有过程奖励模型常受风险补偿效应影响,即错误步骤被后续正确步骤抵消,导致有缺陷的推理路径获得高奖励。这在存在多路径的知识图谱推理中尤为严重。为此,本文提出模式感知累积过程奖励模型(SCPRM),通过条件化推理前缀并融入当前步骤与隐式目标的模式距离,提供累积及未来奖励以指导路径探索。进一步将 SCPRM 集成至蒙特卡洛树搜索中,在医疗、法律等风险敏感任务中显著提升了推理评估的准确性。

AI 推荐理由

论文核心提出过程奖励模型以评估和优化知识图谱推理路径,解决风险补偿问题。

研究机构
HKUST (GZ)
论文信息
作者 Jiujiu Chen, Yazheng Liu, Sihong Xie, Hui Xiong
发布日期 2026-05-04
arXiv ID 2605.02819
相关性评分 9/10 (高度相关)