摘要
针对部分可观测环境中智能体信念漂移及延迟奖励导致的信用分配难题,本文提出 ReBel 算法。该方法通过显式建模结构化信念状态来总结交互历史并指导策略学习。ReBel 引入信念一致性监督,将预测信念与观测反馈的差异转化为密集的自监督信号,无需外部标注;同时采用信念感知分组技术,在相似信念状态下比较轨迹以降低方差。实验表明,ReBel 在 ALFWorld 和 WebShop 基准上显著提升了任务成功率与样本效率。
AI 推荐理由
论文核心提出结构化信念状态以总结交互历史,解决长程任务中的记忆漂移问题。
研究机构
College of Computer, National University of Defense Technology
Intelligent Game and Decision Lab (IGDL)
Institute of Artificial Intelligence, Xiamen University
论文信息