摘要
大型语言模型在多轮对话中性能显著下降,主要源于可靠性失效而非能力不足。根本原因在于扁平化的对话历史对所有 prior turn 赋予同等隐式权重,导致模型无法区分关键约束与 incidental dialog。本文提出 SeDT,一种无需训练的推理时方法,引入离线强化学习中的 return-to-go 条件化机制。该方法通过语义、词汇和位置信号计算累积相关性得分,标注对话片段,使模型在最终回合能识别重要历史信息。实验表明,SeDT 在多种模型和任务中显著提升性能并降低不可靠性。
AI 推荐理由
论文核心解决多轮对话中历史上下文权重分配问题,提出基于相关性的记忆机制。
研究机构
Independent Researcher
Drone Lab, IIT Mandi
UPES, Dehradun
论文信息