摘要
用户在与大语言模型进行多轮对话时,常会细化请求或切换话题。然而,模型往往忽略这些转变,携带无关的先前上下文,导致回复不准确。本文通过构建基于真实数据的合成基准,对十种不同的大语言模型进行了压力测试,重点评估其检测话题转换及筛选相关历史上下文的能力。研究发现,仅部分推理型模型能准确识别话题跳转,开源模型易受陈旧上下文干扰,且所有模型均存在位置偏差。文章据此提出了提升多轮对话长期鲁棒性的关键建议。
AI 推荐理由
论文核心研究多轮对话中的上下文切换与历史记忆筛选机制,直接关联记忆架构。
研究机构
Netflix Inc., Los Gatos, CA, USA
论文信息