Knowledge Editing Surface Compliance Parametric Memory LLM Reliability
摘要

大语言模型将世界知识内化为参数记忆,但继承了源数据的过时与错误。知识编辑旨在无需重训练即可修正记忆,然而现有评估往往仅衡量特定提示下的输出,难以验证真正的记忆修改。本文提出一种基于上下文学习的判别性自评估诊断框架,揭示了“表面顺从”现象:编辑器仅模仿目标输出而未结构性覆盖内部信念。此外,递归修改会积累表征残留,引发认知不稳定并降低记忆状态的可逆性,强调了构建稳健记忆修改机制的重要性。

AI 推荐理由

论文核心研究 LLM 参数记忆的编辑机制、评估框架及表面顺从现象,直接关乎记忆可靠性。

研究机构
Independent Researcher Cornell Tech The Ohio State University The Pennsylvania State University
论文信息
作者 Xiaojie Gu, Ziying Huang, Weicong Hong, Jian Xie, Renze Lou et al.
发布日期 2026-04-07
arXiv ID 2604.05995
相关性评分 9/10 (高度相关)