Tool Use Medical Agents Reinforcement Learning Failure Correction
摘要

医疗 AI 代理常依赖外部工具,但现有方法假设工具可靠,这在临床现实中往往不成立。针对工具在特定实例上失效的问题,本文提出将工具使用建模为实例级选择问题,以缩小“单预言机风险差距”。作者提出一种基于 GRPO 的强化学习框架,结合概率风险最小化奖励与感知分歧的协同学习,并采用熵引导采样策略增强高分歧实例的学习信号。实验表明,该方法在多个医疗基准上显著优于基线,提升了医疗代理系统的可靠性。

AI 推荐理由

论文核心研究医疗场景下 Agent 的工具选择、故障纠正及协同机制,属于技能学习范畴。

研究机构
Fudan University Shanghai Academy of Artificial Intelligence The University of Queensland Shanghai Innovation Institute Bioinformatics Institute (BII), Agency for Science, Technology and Research (A*STAR)
论文信息
作者 Yunhui Gan, Tan Pan, Kaiyu Guo, Limei Han, Weimiao Yu et al.
发布日期 2026-05-26
arXiv ID 2605.26691
相关性评分 9/10 (高度相关)