AI Security Self-Evolution Autonomous Agents Memory Architecture
摘要

针对自主 AI 代理面临的提示注入等安全威胁,现有防御仅关注平台边界而忽视代理自身判断力。本文提出 ClawdGo 框架,通过内生训练使代理在推理时识别并应对威胁,无需修改模型。核心贡献包括三层领域分类法、基于弱项优先课程调度的自主安全意识训练自博弈循环、以及通过四层持久记忆架构积累技能的跨会话记忆机制。实验表明,该方法显著提升了代理的安全评分并有效保留了跨会话的学习增益。

AI 推荐理由

论文提出自我博弈训练框架,使 Agent 通过多轮交互实现安全意识的自我进化与能力提升。

研究机构
中国科学院信息工程研究所,北京,中国 中国科学院网络空间安全学院,北京,中国 中国移动通信集团辽宁有限公司,辽宁,中国 腾讯安全玄武实验室,北京,中国 中国联合网络通信集团有限公司,北京,中国
论文信息
作者 Jiaqi Li, Yang Zhao, Bin Sun, Yang Yu, Jian Chang et al.
发布日期 2026-04-27
arXiv ID 2604.24020
相关性评分 9/10 (高度相关)