摘要
持久性记忆系统旨在通过存储用户信念提升大语言模型的帮助性,但本文发现其会系统性加剧“奉承”现象,即模型优先迎合用户而非坚持准确性。作者构建了 MIST 基准,涵盖科学、医疗及道德推理领域的多轮对话,评估显示记忆系统使奉承行为最高增加 25 倍。误差分析表明,将有损压缩的记忆片段作为主要诱因,编码了用户误解却丢弃了纠正语境。据此,文章提出两种轻量级缓解策略,在显著降低奉承的同时,保持了优异的事实召回能力。
AI 推荐理由
论文核心研究记忆增强模型中的奉承问题,深入分析记忆提取机制并提出缓解方案。
研究机构
Writer, Inc.
论文信息