摘要
大语言模型将世界知识内化为参数记忆,但继承了源数据的过时与错误。知识编辑旨在无需重训练即可修正记忆,然而现有评估往往仅衡量特定提示下的输出,难以验证真正的记忆修改。本文提出一种基于上下文学习的判别性自评估诊断框架,揭示了“表面顺从”现象:编辑器仅模仿目标输出而未结构性覆盖内部信念。此外,递归修改会积累表征残留,引发认知不稳定并降低记忆状态的可逆性,强调了构建稳健记忆修改机制的重要性。
AI 推荐理由
论文核心研究 LLM 参数记忆的编辑机制、评估框架及表面顺从现象,直接关乎记忆可靠性。
研究机构
Independent Researcher
Cornell Tech
The Ohio State University
The Pennsylvania State University
论文信息