摘要
医疗 AI 代理常依赖外部工具,但现有方法假设工具可靠,这在临床现实中往往不成立。针对工具在特定实例上失效的问题,本文提出将工具使用建模为实例级选择问题,以缩小“单预言机风险差距”。作者提出一种基于 GRPO 的强化学习框架,结合概率风险最小化奖励与感知分歧的协同学习,并采用熵引导采样策略增强高分歧实例的学习信号。实验表明,该方法在多个医疗基准上显著优于基线,提升了医疗代理系统的可靠性。
AI 推荐理由
论文核心研究医疗场景下 Agent 的工具选择、故障纠正及协同机制,属于技能学习范畴。
研究机构
Fudan University
Shanghai Academy of Artificial Intelligence
The University of Queensland
Shanghai Innovation Institute
Bioinformatics Institute (BII), Agency for Science, Technology and Research (A*STAR)
论文信息