摘要
长程 LLM Agent 积累的对话历史常超出模型上下文窗口。基于 LLM 的摘要压缩虽能限制长度,但存在信息丢失、阻塞推理及输出不可控等问题。本文提出“并行压缩”方法,通过在多个骨干模型上的实验表明,该方法赋予操作者对摘要体积的细粒度可控性,支持针对性提示工程。在匹配解码量下,相比串行基线,显著降低了端到端延迟并提升了压缩吞吐量,有效解决了长程交互中的记忆保留与效率难题。
AI 推荐理由
论文核心解决长程对话历史超出上下文窗口问题,提出并行压缩机制以优化记忆管理。
研究机构
The Pennsylvania State University
论文信息