摘要
背景:Agent 技能作为模块化单元广泛应用,但医学研究技能需额外保障科学完整性与方法有效性。方法:本研究开发 MedSkillAudit 分层框架,评估技能部署就绪度,并在五类医学研究中测试 75 项技能,通过专家评分与系统一致性量化可靠性。结果:系统共识评分均值为 72.4,57.3% 技能未达有限发布阈值;系统与专家一致性(ICC=0.449)优于专家间基线。结论:领域专用预部署审计为治理医学研究 Agent 技能提供了结构化基础。
AI 推荐理由
论文核心聚焦医疗领域 Agent 技能的审计框架,直接评估技能可靠性与部署标准。
研究机构
AIPPOCH PTE. LTD., Singapore
Department of Pathology, Zhongshan Hospital, Fudan University, Shanghai, China
论文信息