摘要
大型视觉语言模型(LVLM)在皮肤科表现优异,但其在罕见病诊断推理方面的评估尚属空白。现有基准仅关注常见病及最终准确率,忽视了关键的临床推理过程。本文构建 DermCase 基准,包含源自同行评审病例报告的长上下文多模态数据,提供逐步推理链。通过新提出的相似度指标评估 22 个主流模型,发现其在诊断准确性与临床推理上存在显著缺陷。实验表明指令微调可显著提升性能,而直接偏好优化增益有限,揭示了当前模型推理能力的局限性。
AI 推荐理由
论文核心评估并提升 LVLM 在罕见病诊断中的临床推理过程与思维链能力。
研究机构
卡内基梅隆大学
阿拉巴马大学伯明翰分校
澳大利亚国立大学
西澳大学
论文信息