摘要
检索增强生成(RAG)通过测试时提供相关上下文提升模型性能,但预训练获得的参数化知识与检索获取的非参数化知识间的关系尚不明确。本文系统研究了在固定数据预算下,预训练语料规模与检索库规模的权衡。通过在多种模型和数据尺度上的实验,提出了包含模型大小、预训练令牌数和检索库大小的三维扩展框架。研究发现检索的边际效用取决于模型规模、任务类型及预训练饱和度,为可扩展语言建模系统的数据资源分配提供了定量依据和实践指导。
AI 推荐理由
核心研究参数化记忆(预训练)与非参数化记忆(检索)的权衡与扩展律,直接定义记忆架构。
研究机构
Stanford University
Independent Researcher
Patronus AI
The Ohio State University
Carnegie Mellon University
Degen AI Labs
论文信息