摘要
针对现有过程级奖励模型(PRM)基准缺乏医疗领域覆盖的问题,本文提出 MedPRMBench,这是首个专为医疗推理设计的细粒度基准。该基准基于临床推理蓝图,涵盖七类数据源、14 种错误类型及四级严重程度分级,包含大量步级标签数据。实验表明,基于该基准训练的 PRM 能显著提升下游医疗问答准确率,并揭示了当前模型在医疗推理错误检测上的关键缺陷,为未来研究指明方向。
AI 推荐理由
论文聚焦医疗领域的过程级推理评估,核心在于提升和验证 LLM 的复杂推理能力与错误检测。
研究机构
Alibaba Group
China
论文信息