摘要
大型语言模型在医疗诊断中前景广阔,但因临床决策高风险及推理可靠性不足,部署面临挑战。现有调试方法难以帮助开发者理解临床错误、优先处理多样故障或识别重复错误模式。为此,本文提出 VeriLLMed,一种整合外部生物医学知识的视觉分析系统,用于审计和调试医疗 LLM 的诊断推理。该系统将模型输出转化为可比较的推理路径,构建基于知识图谱的参考路径,并识别三类重复诊断错误:关系错误、分支错误和缺失错误。案例研究与专家评估表明,该系统能有效辅助开发者发现不符合临床逻辑的推理并提供改进洞察。
AI 推荐理由
论文核心聚焦于医疗 LLM 的诊断推理可靠性审计与错误模式识别,直接针对推理能力。
研究机构
中国科学院自动化研究所
论文信息