self-improvement internal-reward co-evolution RLHF language-agents
摘要

大型语言模型代理在与环境交互中学习,但长程训练受限于稀疏和延迟奖励。现有方法多依赖事后信用分配或外部奖励模型,难以在推理时提供指导且常将奖励优化与策略优化分离。本文提出 Self-Guide,一种自生成的内部奖励机制,既支持推理时的行动引导,又作为训练时的步级密集奖励。该机制构建了策略与内部奖励的协同进化闭环:更优策略产生更好引导,进而提升内部奖励质量以进一步优化策略。实验表明,该方法在三个基准测试中显著优于仅使用环境奖励的基线。

AI 推荐理由

论文提出策略与内部奖励协同进化机制,核心聚焦 Agent 自我改进与自适应学习。

研究机构
McGill University McMaster University The University of Hong Kong The Hong Kong University of Science and Technology (Guangzhou) Peking University University of California, Los Angeles DeepWisdom Université de Montréal
论文信息
作者 Xinyu Wang, Hanwei Wu, Jingwei Song, Shuyuan Zhang, Jiayi Zhang et al.
发布日期 2026-04-03
arXiv ID 2604.03098
相关性评分 9/10 (高度相关)