医疗推理 思维链忠实度 黑盒评估 可解释性
摘要

闭源大语言模型日益被用于医疗咨询,但其解释可能看似合理却未反映真实推理过程,存在误导风险。本研究对三种主流闭源模型进行系统性黑盒评估,通过因果消融、位置偏差和提示注入三种扰动探测,检验思维链是否因果驱动预测。结合人类评估发现,思维链步骤常非预测主因,且模型易受外部暗示影响。结果表明,医疗领域评估需将忠实度置于与准确率同等重要的地位,以保障临床安全。

AI 推荐理由

论文核心评估医疗场景下思维链(CoT)的因果忠实度,直接探究推理机制的真实性。

研究机构
Stratified Precision, United Kingdom Harvard Medical School, United States Imperial College London, United Kingdom
论文信息
作者 Halimat Afolabi, Zainab Afolabi, Elizabeth Friel, Jude Roberts, Antonio Ji-Xu et al.
发布日期 2026-03-14
arXiv ID 2603.13988
相关性评分 9/10 (高度相关)