摘要
深度搜索使 Agent 能检索细粒度历史信息,但现有系统因无法从过往优劣轨迹中学习而重犯错误。本文提出 R^2-Mem,一种面向记忆系统的反思性经验框架。离线阶段利用准则引导评估器评分历史轨迹步骤,并由自反思学习者提炼抽象经验;在线推理时,检索到的经验指导后续搜索以避免重复错误。实验表明,该方法显著提升效果与效率,F1 分数最高提升 22.6%,同时降低 Token 消耗与搜索迭代次数,为自改进 LLM Agent 提供了无强化学习的低成本方案。
AI 推荐理由
论文核心提出基于反思经验的记忆搜索框架,直接优化 Agent 记忆检索机制。
研究机构
University of Science and Technology of China
论文信息