Machine Unlearning Memory Graph Privacy LLM Safety
摘要

大型语言模型可能记忆敏感或受版权保护的内容,引发隐私与法律担忧。现有机器遗忘范式依赖用户提供的遗忘集,难以审计且易受滥用。本文提出 MAGE 框架,仅需轻量级用户锚点即可探测目标相关记忆,构建加权局部记忆图,并合成范围化的遗忘监督信号。该方法无需原始训练语料,适用于多种模型。实验表明,MAGE 生成的自监督信号在保持模型效用的同时,实现了与外部参考监督相当的有效遗忘效果,推动了实用且可审计的遗忘工作流。

AI 推荐理由

论文核心提出基于记忆图的机制来探测和消除 LLM 中的特定记忆,直接针对记忆架构与管理。

研究机构
上海交通大学计算机科学与工程学院 华东师范大学电子科学与技术学院
论文信息
作者 Wenxuan Li, Zhenfei Zhang, Mi Zhang, Geng Hong, Mi Wen et al.
发布日期 2026-04-15
arXiv ID 2604.13777
相关性评分 9/10 (高度相关)