摘要
针对自主 AI 代理面临的提示注入等安全威胁,现有防御仅关注平台边界而忽视代理自身判断力。本文提出 ClawdGo 框架,通过内生训练使代理在推理时识别并应对威胁,无需修改模型。核心贡献包括三层领域分类法、基于弱项优先课程调度的自主安全意识训练自博弈循环、以及通过四层持久记忆架构积累技能的跨会话记忆机制。实验表明,该方法显著提升了代理的安全评分并有效保留了跨会话的学习增益。
AI 推荐理由
论文提出自我博弈训练框架,使 Agent 通过多轮交互实现安全意识的自我进化与能力提升。
研究机构
中国科学院信息工程研究所,北京,中国
中国科学院网络空间安全学院,北京,中国
中国移动通信集团辽宁有限公司,辽宁,中国
腾讯安全玄武实验室,北京,中国
中国联合网络通信集团有限公司,北京,中国
论文信息