摘要
基于大语言模型的临床推理代理旨在自动化重症监护监测等任务。现有系统依赖人工策划的工具库,维护成本高且零样本代码生成效率低。本文提出 CodeClinic 基准,基于 MIMIC-IV 数据集,评估代理合成与组合可复用临床技能的能力。该基准包含纵向 ICU 监控和组合式信息检索两项任务。此外,作者提出离线自动形式化流程,将自然语言指南转化为经迭代优化的可复用 Python 技能库。实验表明,相比零样本生成,该方法显著提升了 consistency 并减少了 40% 的 token 消耗。
AI 推荐理由
论文核心在于评估和构建 LLM 代理合成及组合可复用临床技能的能力,替代固定工具库。
研究机构
University of Wisconsin-Madison
Microsoft Research
论文信息