摘要
针对临床 AI 部署中置信度校准不足的问题,本文提出一种结合领域专家智能体与两阶段验证的多智能体框架。四个专科智能体独立生成诊断,经内部一致性检验产生专家置信分(S-score),驱动加权融合策略以优化最终答案及置信度报告。实验显示,该方法在多个医疗基准测试中将预期校准误差(ECE)降低 49%-74%,显著提升不确定性估计的可靠性,为安全关键型临床应用提供实用的置信信号。
AI 推荐理由
论文核心提出多智能体推理框架,通过一致性验证机制显著提升医疗问答中的推理可靠性与不确定性校准。
研究机构
Harrisburg University of Science and Technology
论文信息