摘要
大型语言模型智能体在特定任务中表现优异,但难以适应具有反馈的非平稳环境。现有上下文学习与外部记忆方法无法内化长期改进所需的适应能力。本文提出 MAGE,一种赋能智能体进行战略探索与利用的元强化学习框架。该框架通过多轮次训练机制,将交互历史与反思融入上下文,以最终回报为目标激励智能体基于过往经验优化策略。结合基于种群的训练与智能体特定的优势归一化技术,增强了多样性并确保学习稳定。实验表明,MAGE 在探索与利用任务上优于基线,并对未见对手展现出强大的泛化能力,证明其已内化战略适应能力。
AI 推荐理由
论文提出基于元强化学习的框架,使智能体通过反思和历史交互实现策略自我改进与适应,核心聚焦自我进化。
研究机构
清华大学
论文信息