摘要
本文提出 MR-Search,一种结合自我反思的上下文元强化学习框架,用于代理搜索。不同于在单轮次中优化策略,MR-Search 训练的策略依赖于历史轮次,能跨轮次自适应调整搜索策略。该方法通过在每轮后生成显式自我反思并作为后续尝试的上下文,实现了测试时的持续学习与探索优化。此外,文章引入多轮次 RL 算法以估算细粒度优势,实现更精准的信用分配。实验表明,该方法在八个基准测试中较基线提升显著,展现出强大的泛化能力。
AI 推荐理由
论文核心在于通过自我反思实现跨轮次策略自适应与持续改进,属自我进化范畴。
研究机构
AI-2
华盛顿大学
独立研究者
论文信息