摘要
针对当前文本嵌入与生成任务分离训练导致的高成本问题,本文提出 GRC 框架,在单次前向传播中统一推理驱动的生成、增强型文本表示及上下文压缩。通过元潜变量 token 及统一调优方法,该模型实现了模块化灵活性,显著降低 RAG 部署难度并提升数据利用率。此外,框架引入了“自推理潜变量嵌入”新范式及“潜变量记忆增强生成”,利用 O(1) 长度的内部化压缩 KV 缓存作为可更新记忆,有效支持长上下文与持续学习场景下的智能体任务。
AI 推荐理由
提出潜变量记忆增强生成,利用 O(1) 长度压缩 KV 缓存作为可更新记忆,核心解决长上下文记忆问题。
研究机构
东京大学
论文信息