摘要
检索增强生成(RAG)系统依赖向量表示的几何特性检索证据。当源文档混合多主题时,标准向量化导致语义不同内容在嵌入空间重叠,即“语义纠缠”。本文形式化该概念并提出纠缠指数(EI),指出高 EI 限制检索精度。为此,作者提出语义解缠流水线(SDP),一种四阶段预处理框架,包含上下文条件化预处理及基于代理性能的连续反馈机制。在医疗知识库上的评估显示,SDP 将 Top-K 检索精度从 32% 提升至 82%,显著降低了语义纠缠。
AI 推荐理由
论文核心研究 RAG 中的检索机制与上下文管理,属于 Agent 记忆架构的关键部分。
研究机构
Salesforce; School of Information Studies, Syracuse University
论文信息