摘要
检索增强生成结合强化学习在将大语言模型 grounded 于可信医疗证据方面展现出潜力。然而,现有方法依赖精确匹配的二元奖励,导致临床诊断中出现两个问题:语义相关但非逐字匹配的步骤无法获得信号,以及单一维度奖励难以监督异构推理能力。为此,本文提出 C-MIG,一种基于多视图信息增益的临床诊断检索增强生成框架。该方法从检索文档和文档优化两个互补视角估计信息增益,联合指导检索内容与优化策略,缓解奖励信号丢失与信用分配问题。此外,设计了多子查询检索增强策略以提升临床场景下的知识召回覆盖率。实验表明,C-MIG 在多个医疗基准测试中优于现有 RAG-RL 方法及通用大模型。
AI 推荐理由
论文聚焦临床诊断推理,提出多视图信息增益机制优化 RAG-RL 的推理监督信号,核心解决推理能力问题。
研究机构
Baidu Inc.
论文信息