belief state long-horizon tasks partial observability context compression reinforcement learning
摘要

大型语言模型在部分可观察的长程任务中面临两大挑战:需维持对未观测属性的不确定性,且交互历史导致上下文无限增长稀释关键信息。本文提出 Agent-BRACE 方法,将智能体解耦为信念状态模型与策略模型。信念模型生成结构化近似信念分布,即带有序语言化确定性标签的自然语言主张集;策略模型基于此紧凑信念而非完整历史进行决策。实验表明,该方法在保持上下文窗口恒定的同时,显著提升了长程任务性能,且 learned 信念随证据积累愈发校准。

AI 推荐理由

提出信念状态模型以紧凑编码历史,解决长程任务中上下文无限增长问题,核心在于记忆架构。

研究机构
UNC Chapel Hill The University of Texas at Austin Microsoft Research
论文信息
作者 Joykirat Singh, Zaid Khan, Archiki Prasad, Justin Chih-Yao Chen, Akshay Nambi et al.
发布日期 2026-05-12
arXiv ID 2605.11436
相关性评分 9/10 (高度相关)