摘要
具备推理能力的大语言模型在医疗推理基准上表现优异,但其在结构化临床文档生成中的增益尚不明确。本研究利用涵盖多个数据集的源感知基准,评估了不同模型在开启或关闭原生推理及同源检索增强生成(RAG)配置下的表现。结果显示,非推理配置的 GPT-5.4 整体质量最高,而开启推理显著降低了其性能。研究表明,在未进行特定任务评估前,不应假设更强的推理能力能提升对保真度敏感的 SOAP 笔记生成质量。
AI 推荐理由
核心研究推理能力在特定任务中的负面影响及评估,直接探讨推理机制的效用边界。
研究机构
University of California, Davis
论文信息