摘要
基于大语言模型的代理在长程推理中潜力巨大,但受限于部署因素导致的上下文预算约束。随着交互历史增长,需在保留信息与遵守限制间权衡。本文提出预算感知上下文管理(BACM),将上下文管理建模为带预算约束的序列决策问题,使代理能评估可用预算并决定压缩策略。进一步开发 BACM-RL,一种基于课程的端到端强化学习方法,用于在不同预算下学习压缩策略。实验表明该方法在多目标问答及网页浏览任务中显著优于基线。
AI 推荐理由
论文核心提出预算感知的上下文管理机制,直接解决长程交互中的记忆压缩与保留问题。
研究机构
浙江大学, 杭州, 中国
阿里巴巴集团, 杭州, 中国
论文信息