摘要
胸部 X 光在胸腔诊断中至关重要,其解读本质上需要多步且基于证据的推理。然而,大型视觉语言模型(LVLMs)常生成看似合理却缺乏诊断证据支撑的回答,且难以验证,适应新任务需高昂重训练成本。为此,本文提出 CXReasonAgent,该智能体整合大语言模型与临床诊断工具,利用图像衍生的诊断与视觉证据执行基于证据的推理。研究还引入了包含 12 项任务、1946 轮对话的多轮对话基准 CXReasonDial。实验表明,CXReasonAgent 能生成忠实于证据的回答,在安全性和可验证性上优于现有 LVLMs。
AI 推荐理由
论文核心聚焦于基于证据的多步诊断推理,旨在解决 LVLM 缺乏忠实推理的问题。
研究机构
KAIST
论文信息