摘要
大型语言模型在部分可观察的长程任务中面临两大挑战:需维持对未观测属性的不确定性,且交互历史导致上下文无限增长稀释关键信息。本文提出 Agent-BRACE 方法,将智能体解耦为信念状态模型与策略模型。信念模型生成结构化近似信念分布,即带有序语言化确定性标签的自然语言主张集;策略模型基于此紧凑信念而非完整历史进行决策。实验表明,该方法在保持上下文窗口恒定的同时,显著提升了长程任务性能,且 learned 信念随证据积累愈发校准。
AI 推荐理由
提出信念状态模型以紧凑编码历史,解决长程任务中上下文无限增长问题,核心在于记忆架构。
研究机构
UNC Chapel Hill
The University of Texas at Austin
Microsoft Research
论文信息