摘要
本文指出主流 Claws 个人智能体存在关键安全漏洞:心跳驱动的后台执行中遇到的不可信内容可静默污染代理记忆,进而无意识地影响用户交互行为。该漏洞源于架构设计缺陷,即后台任务与前台对话共享会话上下文,导致外部源信息进入记忆空间。研究形式化了“暴露 - 记忆 - 行为”路径,并通过模拟实验发现,社交共识线索可致高达 61% 的短期误导,常规记忆保存行为更使 91% 的污染固化为长期记忆,跨会话行为影响达 76%。
AI 推荐理由
论文核心揭示后台执行导致记忆污染机制,深入分析短期至长期记忆写入路径。
研究机构
南京理工大学
中国科学院自动化研究所(A*STAR)
约翰斯·霍普金斯大学
论文信息