Agent Safety Self-Evolving Computer-Use Agents Adaptive Defense
摘要

计算机使用智能体将语言模型扩展至与文件、终端及浏览器的持续交互,引发了难以通过孤立提示检测的安全风险。本文提出 BraveGuard,一种用于训练防护模型的自我进化防御框架。该框架通过挖掘开源研究识别新兴威胁模式,将其实例化为可执行任务,收集智能体轨迹并生成监督信号。面对新威胁时,流程可重复执行,形成自适应防御闭环而非静态训练。实验表明,BraveGuard 在轨迹级安全检测上显著优于现有模型,准确率从 38.79% 提升至 82.38%,为应对不断演变的现实风险提供了可扩展路径。

AI 推荐理由

论文提出自我进化防御框架,通过持续挖掘新威胁并迭代训练,实现自适应安全防御。

研究机构
四川大学 蚂蚁集团
论文信息
作者 Yunhao Feng, Yifan Ding, Xiaohu Du, Ming Wen, Xinhao Deng et al.
发布日期 2026-05-31
arXiv ID 2606.01166
相关性评分 9/10 (高度相关)