摘要
大型语言模型代理在与环境交互中学习,但长程训练受限于稀疏和延迟奖励。现有方法多依赖事后信用分配或外部奖励模型,难以在推理时提供指导且常将奖励优化与策略优化分离。本文提出 Self-Guide,一种自生成的内部奖励机制,既支持推理时的行动引导,又作为训练时的步级密集奖励。该机制构建了策略与内部奖励的协同进化闭环:更优策略产生更好引导,进而提升内部奖励质量以进一步优化策略。实验表明,该方法在三个基准测试中显著优于仅使用环境奖励的基线。
AI 推荐理由
论文提出策略与内部奖励协同进化机制,核心聚焦 Agent 自我改进与自适应学习。
研究机构
McGill University
McMaster University
The University of Hong Kong
The Hong Kong University of Science and Technology (Guangzhou)
Peking University
University of California, Los Angeles
DeepWisdom
Université de Montréal
论文信息