摘要
大型语言模型可能记忆敏感或受版权保护的内容,引发隐私与法律担忧。现有机器遗忘范式依赖用户提供的遗忘集,难以审计且易受滥用。本文提出 MAGE 框架,仅需轻量级用户锚点即可探测目标相关记忆,构建加权局部记忆图,并合成范围化的遗忘监督信号。该方法无需原始训练语料,适用于多种模型。实验表明,MAGE 生成的自监督信号在保持模型效用的同时,实现了与外部参考监督相当的有效遗忘效果,推动了实用且可审计的遗忘工作流。
AI 推荐理由
论文核心提出基于记忆图的机制来探测和消除 LLM 中的特定记忆,直接针对记忆架构与管理。
研究机构
上海交通大学计算机科学与工程学院
华东师范大学电子科学与技术学院
论文信息