Reinforcement Learning Uncertainty Estimation Self-Evolution Reward Shaping
摘要

大语言模型作为多步决策智能体时,有效的奖励设计至关重要。现有研究常忽视模型内在不确定性这一关键信号。本文提出 SELAUR 框架,将熵、最低置信度及边界-based 指标整合为令牌级不确定性估计,并引入故障感知奖励重塑机制,将这些信号注入步骤与轨迹级奖励中。该方法在 ALFWorld 和 WebShop 基准测试中显著提升了成功率,增强了探索效率与学习稳定性,实现了智能体的自我进化。

AI 推荐理由

论文提出基于不确定性奖励的自我进化框架,核心机制直接驱动 Agent 自我改进与适应。

研究机构
约翰霍普金斯大学,美国马里兰州巴尔的摩 亚利桑那州立大学,美国亚利桑那州坦佩 伊利诺伊大学芝加哥分校,美国伊利诺伊州芝加哥 普渡大学,美国印第安纳州西拉法叶
论文信息
作者 Dengjia Zhang, Xiaoou Liu, Lu Cheng, Yaqing Wang, Kenton Murray et al.
发布日期 2026-02-24
arXiv ID 2602.21158
相关性评分 9/10 (高度相关)