Process Reward Models Medical Reasoning Benchmark Error Detection
摘要

针对现有过程级奖励模型(PRM)基准缺乏医疗领域覆盖的问题,本文提出 MedPRMBench,这是首个专为医疗推理设计的细粒度基准。该基准基于临床推理蓝图,涵盖七类数据源、14 种错误类型及四级严重程度分级,包含大量步级标签数据。实验表明,基于该基准训练的 PRM 能显著提升下游医疗问答准确率,并揭示了当前模型在医疗推理错误检测上的关键缺陷,为未来研究指明方向。

AI 推荐理由

论文聚焦医疗领域的过程级推理评估,核心在于提升和验证 LLM 的复杂推理能力与错误检测。

研究机构
Alibaba Group China
论文信息
作者 Lingyan Wu, Xiang Zheng, Weiqi Zhai, Wei Wang, Xuan Ren et al.
发布日期 2026-04-19
arXiv ID 2604.17282
相关性评分 9/10 (高度相关)