Clinical Agents Skill Synthesis Code Generation Benchmark
摘要

基于大语言模型的临床推理代理旨在自动化重症监护监测等任务。现有系统依赖人工策划的工具库,维护成本高且零样本代码生成效率低。本文提出 CodeClinic 基准,基于 MIMIC-IV 数据集,评估代理合成与组合可复用临床技能的能力。该基准包含纵向 ICU 监控和组合式信息检索两项任务。此外,作者提出离线自动形式化流程,将自然语言指南转化为经迭代优化的可复用 Python 技能库。实验表明,相比零样本生成,该方法显著提升了 consistency 并减少了 40% 的 token 消耗。

AI 推荐理由

论文核心在于评估和构建 LLM 代理合成及组合可复用临床技能的能力,替代固定工具库。

研究机构
University of Wisconsin-Madison Microsoft Research
论文信息
作者 Timothy Ossowski, Xinchi Liu, Danyal Maqbool, Vaibhav Dhanuka, Sheng Zhang et al.
发布日期 2026-05-10
arXiv ID 2605.09675
相关性评分 9/10 (高度相关)