摘要
有效的医疗代理需具备回忆并推理患者纵向病史的能力,但缺乏真实的长程对话数据限制了系统评估。本文提出一种框架,利用大语言模型合成高质量长程医疗对话。该方法通过知识引导分解为三个阶段:构建具有多样疾病轨迹的合成患者档案、生成单次就诊的多轮对话,并将其整合为连贯的纵向数据集 MediLongChat。我们建立了三项基准任务以评估医疗代理的记忆能力,并引入结合向量指标与大模型评判的多维评估框架。实验表明,即使是最先进的大模型在该基准上也表现挣扎,凸显了开发专用方法的必要性。
AI 推荐理由
论文核心在于构建长程医疗对话数据集以评估 Agent 的跨会话记忆与推理能力。
研究机构
South-Central Minzu University
Wuhan, China
Singapore Management University
Singapore, Singapore
论文信息