摘要
强化学习显著提升了大语言模型代理交互环境及解决多轮任务的能力,但稀疏奖励导致步骤信用分配困难。现有密集监督方法增加了复杂度且泛化性差。本文提出 AEM,一种无监督信用分配方法,通过在强化学习训练中自适应调制熵动态,优化探索与利用的权衡。理论上将熵分析从令牌级提升至响应级,推导实用代理以重塑训练动态,实现自然过渡。实验表明,该方法在多个基准测试及不同规模模型上均有效,尤其在 SWE-bench-Verified 上显著提升性能。
AI 推荐理由
论文提出无监督信用分配方法,通过自适应调节熵实现 Agent 自我优化与探索利用平衡,属自我进化核心机制。
研究机构
Baidu
Tsinghua University
Fudan University
论文信息