Meta-Reinforcement Learning Self-Reflection Agent Evolution Adaptive Search
摘要

本文提出 MR-Search,一种结合自我反思的上下文元强化学习框架,用于代理搜索。不同于在单轮次中优化策略,MR-Search 训练的策略依赖于历史轮次,能跨轮次自适应调整搜索策略。该方法通过在每轮后生成显式自我反思并作为后续尝试的上下文,实现了测试时的持续学习与探索优化。此外,文章引入多轮次 RL 算法以估算细粒度优势,实现更精准的信用分配。实验表明,该方法在八个基准测试中较基线提升显著,展现出强大的泛化能力。

AI 推荐理由

论文核心在于通过自我反思实现跨轮次策略自适应与持续改进,属自我进化范畴。

研究机构
AI-2 华盛顿大学 独立研究者
论文信息
作者 Teng Xiao, Yige Yuan, Hamish Ivison, Huaisheng Zhu, Faeze Brahman et al.
发布日期 2026-03-11
arXiv ID 2603.11327
相关性评分 9/10 (高度相关)