摘要
单步检索增强生成(RAG)难以应对复杂问题,而代理 RAG 虽通过多步迭代解决该问题,却因自回归生成长文本导致高延迟。本文提出 LatentRAG 框架,将推理与检索从离散语言空间迁移至连续潜空间。该方法直接从隐藏状态单次前向传播生成代表思维和子查询的潜令牌,并与稠密检索模型对齐,支持端到端联合优化。此外,引入并行潜解码机制以提升透明度。实验表明,该方法在保持性能的同时降低约 90% 推理延迟。
AI 推荐理由
提出潜空间推理新范式,将离散思维链转为连续隐状态,核心优化推理效率。
研究机构
University of Amsterdam, Amsterdam, the Netherlands
论文信息