多轮对话 意图追踪 记忆压缩 主动交互 强化学习
摘要

尽管大语言模型对话系统每日处理海量多轮对话,但其本质仍是被动响应。实现主动交互的关键在于仅依据前序对话预测用户下一查询。针对现有方法在完整历史拼接导致令牌消耗线性增长与截断历史丢失跨轮上下文之间的效率 - 质量权衡难题,本文提出 OnePred。该方法维护一个递归更新的记忆作为唯一的跨轮上下文,使每轮成本独立于对话长度。通过两阶段强化学习流水线,模型先学习预测内容再学习压缩策略,将记忆塑造为面向预测的意图链。实验表明,OnePred 在预测质量上超越所有基线,同时将每轮令牌消耗降低高达 22 倍。

AI 推荐理由

论文核心提出递归意图记忆机制,解决多轮对话历史管理效率与质量权衡问题。

研究机构
清华大学 阿里巴巴集团通义实验室
论文信息
作者 Jiangwang Chen, Bowen Zhang, Zixin Song, Jiazheng Kang, Xiao Yang et al.
发布日期 2026-05-22
arXiv ID 2605.23668
相关性评分 9/10 (高度相关)