Reinforcement Learning Self-Evolution Sparse Reward Mutual Information LLM Agents
摘要

针对大语言模型智能体在强化学习中面临的稀疏奖励挑战,本文提出互信息自评估(MISE)范式。该方法利用后见生成性自评估作为密集奖励信号,并针对环境反馈进行校准,使智能体能从密集内部奖励中自主学习。理论上,本文首次为生成性自奖励范式奠定形式化基础,证明利用后见自评估等价于最小化结合互信息与策略间 KL 散度的目标。实验表明,MISE 优于强基线,使 7B 参数开源模型在无专家监督下达到媲美 GPT-4o 的性能。

AI 推荐理由

论文提出基于自我评估的强化学习范式,实现 Agent 在无监督下的自主进化与策略校准。

研究机构
北京理工大学
论文信息
作者 Jiashu Yao, Heyan Huang, Zeming Liu, Yuhang Guo
发布日期 2026-04-13
arXiv ID 2604.11611
相关性评分 9/10 (高度相关)