Reinforcement Learning Memory Mechanism LLM Agent Exploration
摘要

针对强化学习训练的大语言模型智能体在探索新颖状态时的瓶颈,本文提出了探索性记忆增强在线与离线策略优化(EMPO²)框架。该方法利用记忆机制辅助探索,并结合在线与离线策略更新,确保智能体在使用记忆时表现优异,且在无记忆时具备鲁棒性。实验表明,EMPO²在 ScienceWorld 和 WebShop 基准上显著优于基线方法,并在分布外测试中展现出卓越的适应性,仅需少量试错即可适应新任务而无需参数更新。

AI 推荐理由

论文提出基于记忆的混合 RL 框架,记忆是解决探索瓶颈的核心机制。

研究机构
Microsoft Research KAIST
论文信息
作者 Zeyuan Liu, Jeonghye Kim, Xufang Luo, Dongsheng Li, Yuqing Yang
发布日期 2026-02-26
arXiv ID 2602.23008
相关性评分 9/10 (高度相关)