Context Management Reinforcement Learning Long-Horizon Agents Memory Compression
摘要

基于大语言模型的代理在长程推理中潜力巨大,但受限于部署因素导致的上下文预算约束。随着交互历史增长,需在保留信息与遵守限制间权衡。本文提出预算感知上下文管理(BACM),将上下文管理建模为带预算约束的序列决策问题,使代理能评估可用预算并决定压缩策略。进一步开发 BACM-RL,一种基于课程的端到端强化学习方法,用于在不同预算下学习压缩策略。实验表明该方法在多目标问答及网页浏览任务中显著优于基线。

AI 推荐理由

论文核心提出预算感知的上下文管理机制,直接解决长程交互中的记忆压缩与保留问题。

研究机构
浙江大学, 杭州, 中国 阿里巴巴集团, 杭州, 中国
论文信息
作者 Yong Wu, YanZhao Zheng, TianZe Xu, ZhenTao Zhang, YuanQiang Yu et al.
发布日期 2026-04-02
arXiv ID 2604.01664
相关性评分 9/10 (高度相关)