Long-context Dialogue Consistency Self-Recall Efficiency
摘要

基于大语言模型的多轮对话系统常难以追踪非相邻话轮间的依赖关系,导致一致性与扩展性受损。随着对话延长,关键信息稀疏化并淹没于无关上下文中,而处理完整历史则引发效率瓶颈。现有方案或依赖高延迟外部记忆,或因迭代摘要丢失细粒度细节。本文提出自召回思维(SRT)框架,旨在解决多轮对话中的长程上下文依赖与稀疏信息信号问题。SRT 通过识别有益的历史话轮生成语境适宜的响应,使模型在推理过程中能选择性召回并推理上下文。该过程产生了无需外部模块即可整合可解释召回步骤的内生推理机制。实验表明,SRT 在多个数据集上将 F1 分数提升了 4.7%,端到端延迟降低了 14.7%,实现了推理延迟与准确性的平衡,优于现有最先进基线。

AI 推荐理由

论文提出自召回机制解决长对话依赖,核心聚焦记忆架构与历史信息管理。

研究机构
西北工业大学
论文信息
作者 Renning Pang, Tian Lan, Leyuan Liu, Xiaoming Huang, Piao Tong et al.
发布日期 2026-05-14
arXiv ID 2605.15102
相关性评分 9/10 (高度相关)