摘要
闭源大语言模型日益被用于医疗咨询,但其解释可能看似合理却未反映真实推理过程,存在误导风险。本研究对三种主流闭源模型进行系统性黑盒评估,通过因果消融、位置偏差和提示注入三种扰动探测,检验思维链是否因果驱动预测。结合人类评估发现,思维链步骤常非预测主因,且模型易受外部暗示影响。结果表明,医疗领域评估需将忠实度置于与准确率同等重要的地位,以保障临床安全。
AI 推荐理由
论文核心评估医疗场景下思维链(CoT)的因果忠实度,直接探究推理机制的真实性。
研究机构
Stratified Precision, United Kingdom
Harvard Medical School, United States
Imperial College London, United Kingdom
论文信息