Privacy Risk Data Extraction Attack Task-Oriented Dialogue Memorization
摘要

大语言模型(LLM)虽增强了任务型对话系统,但其作为软知识库压缩训练数据,引发了严重的隐私泄露风险,可能无意中记忆包含个人身份信息或完整事件的交易数据。本文填补了该领域空白,通过系统性量化研究,评估现有提取攻击的局限性,并提出针对 LLM 任务机器人的新型攻击技术,优化响应采样与成员推断。实验表明,该方法能高精度提取数千条对话状态标签。此外,文章深入分析了影响记忆的关键因素并探讨了缓解策略。

AI 推荐理由

论文核心研究 LLM 在任务型对话中对训练数据的记忆机制、遗忘风险及提取攻击。

研究机构
中国科学院自动化研究所
论文信息
作者 Shuo Zhang, Junzhou Zhao, Junji Hou, Pinghui Wang, Chenxu Wang et al.
发布日期 2026-03-02
arXiv ID 2603.01550
相关性评分 9/10 (高度相关)