摘要
大型语言模型在政治敏感环境部署时,其对个人数据或机密内容的记忆引发了 GDPR 及“被遗忘权”等法规的合规担忧。将法律原则转化为大规模生成系统面临巨大技术挑战。本文提出一种轻量级顺序遗忘框架,明确分离保留与抑制目标。该方法首先通过正向微调稳定良性能力,随后应用层受限的负向微调以抑制指定敏感模式,同时保持通用语言能力。实验表明,该方法能有效抑制行为且对事实准确性和流畅度影响极小,为落实数据擦除要求提供了实用机制。
AI 推荐理由
论文核心研究 LLM 的记忆消除机制,直接针对“被遗忘权”和数据记忆管理。
研究机构
蒙斯特理工大学数学系
蒙斯特理工大学计算机科学系
论文信息