LVLM 医疗诊断 临床推理 基准测试
摘要

大型视觉语言模型(LVLM)在皮肤科表现优异,但其在罕见病诊断推理方面的评估尚属空白。现有基准仅关注常见病及最终准确率,忽视了关键的临床推理过程。本文构建 DermCase 基准,包含源自同行评审病例报告的长上下文多模态数据,提供逐步推理链。通过新提出的相似度指标评估 22 个主流模型,发现其在诊断准确性与临床推理上存在显著缺陷。实验表明指令微调可显著提升性能,而直接偏好优化增益有限,揭示了当前模型推理能力的局限性。

AI 推荐理由

论文核心评估并提升 LVLM 在罕见病诊断中的临床推理过程与思维链能力。

研究机构
卡内基梅隆大学 阿拉巴马大学伯明翰分校 澳大利亚国立大学 西澳大学
论文信息
作者 Yang Liu, Jiyao Yang, Hongjin Zhao, Xiaoyong Li, Yanzhe Ji et al.
发布日期 2026-03-19
arXiv ID 2603.18418
相关性评分 9/10 (高度相关)