摘要
针对大语言模型智能体在强化学习中面临的稀疏奖励挑战,本文提出互信息自评估(MISE)范式。该方法利用后见生成性自评估作为密集奖励信号,并针对环境反馈进行校准,使智能体能从密集内部奖励中自主学习。理论上,本文首次为生成性自奖励范式奠定形式化基础,证明利用后见自评估等价于最小化结合互信息与策略间 KL 散度的目标。实验表明,MISE 优于强基线,使 7B 参数开源模型在无专家监督下达到媲美 GPT-4o 的性能。
AI 推荐理由
论文提出基于自我评估的强化学习范式,实现 Agent 在无监督下的自主进化与策略校准。
研究机构
北京理工大学
论文信息