摘要
针对强化学习训练的大语言模型智能体在探索新颖状态时的瓶颈,本文提出了探索性记忆增强在线与离线策略优化(EMPO²)框架。该方法利用记忆机制辅助探索,并结合在线与离线策略更新,确保智能体在使用记忆时表现优异,且在无记忆时具备鲁棒性。实验表明,EMPO²在 ScienceWorld 和 WebShop 基准上显著优于基线方法,并在分布外测试中展现出卓越的适应性,仅需少量试错即可适应新任务而无需参数更新。
AI 推荐理由
论文提出基于记忆的混合 RL 框架,记忆是解决探索瓶颈的核心机制。
研究机构
Microsoft Research
KAIST
论文信息