摘要
本文针对 FHIR 标准下医疗数据交互的复杂性,研究了代理在执行多步推理、过滤及聚合任务时易选错资源或违反约束的问题。作者将 FHIR 推理建模为结构化图上的序列决策问题,构建了 FHIR-AgentBench 基准,并实现了一个多轮 CodeAct 代理。通过利用自定义环境与工具进行强化学习后训练,并结合基于执行结果的奖励机制,该方法显著提升了性能。实验表明,相较于提示工程基线,RL 后训练在确保数据完整性的同时,将较小模型的回答正确率从 50% 提升至 77%,提供了一套可靠的端到端训练流程。
AI 推荐理由
论文核心研究 Agent 在特定领域(FHIR)的工具调用能力,通过 RL 优化资源选择与约束遵守。
研究机构
1
2
论文信息