摘要
多数代理大模型在临床基准上的提升归因于提示工程,但本文表明架构与引擎级设计带来更大改进。我们提出 MDIA,一种在非微调大模型上实现的七节点专科路由临床推理图多智能体诊断系统。在 HealthBench Professional 基准测试中,MDIA 得分显著超越 ChatGPT 临床版。实验证明性能提升源于系统架构:包括专科路由、多轮上下文保持、药物状态安全门控及引擎级可靠性。研究还发现评估器模型选择会影响结果,强调需多模型独立评估以确保鲁棒性。
AI 推荐理由
论文核心在于多智能体架构设计与任务路由规划,通过系统编排提升临床推理性能。
研究机构
TietAI
论文信息