Context Compression Long-term Memory RLVR Multi-turn Agents
摘要

自适应上下文压缩对于将大语言模型扩展至复杂多轮代理任务至关重要。针对规则方法易丢失关键信息及强化学习在稀疏奖励下难以平衡信息保留与效率的问题,本文提出 ZipRL 框架。该框架结合多粒度压缩机制与事后响应回放(HRR)技术,通过粗到细提示实现宏观压缩,并利用广义优势重塑优化训练信号。理论证明其优于均匀方法,实验显示在多个基准测试中显著超越最先进方案,同时在极端长程压力下保持卓越的令牌效率与鲁棒性。

AI 推荐理由

论文核心研究多轮对话中的自适应上下文压缩机制,直接解决 Agent 长期记忆与信息管理难题。

研究机构
Meituan Institute of Software, Chinese Academy of Sciences
论文信息
作者 Zhexin Hu, Li Wang, Xiaohan Wang, Jiajun Chai, Xiaojun Guo et al.
发布日期 2026-05-27
arXiv ID 2605.28069
相关性评分 9/10 (高度相关)