Lost-in-Conversation Self-Distillation Dialogue History Memory Contamination
摘要

大型语言模型在多轮对话中常因“对话迷失”(LiC)导致性能下降,部分归因于中间回复引发的自我污染。为此,本文提出 MAIGO,一种基于在线策略的自蒸馏方法,利用模型自身策略生成的清洗后历史作为参考,减少污染。该方法在中间轮次移除助手回复但保留用户可见前缀,在回答轮次则基于完整用户对话进行蒸馏,并引入可靠性权重降低不一致样本的影响。实验表明,MAIGO 显著提升了 Qwen2.5-7B-Instruct 在分片视图下的准确率,证明自我污染是可训练的 LiC gap 组成部分。

AI 推荐理由

论文核心解决多轮对话中历史记忆污染问题,提出清理历史记忆的蒸馏方法。

研究机构
浙江大学 腾讯 上海人工智能实验室
论文信息
作者 Haoyu Zheng, Yun Zhu, Shu Yuan, Shangming Chen, Qing Wang et al.
发布日期 2026-05-26
arXiv ID 2605.27186
相关性评分 9/10 (高度相关)