摘要
计算机使用智能体将语言模型扩展至与文件、终端及浏览器的持续交互,引发了难以通过孤立提示检测的安全风险。本文提出 BraveGuard,一种用于训练防护模型的自我进化防御框架。该框架通过挖掘开源研究识别新兴威胁模式,将其实例化为可执行任务,收集智能体轨迹并生成监督信号。面对新威胁时,流程可重复执行,形成自适应防御闭环而非静态训练。实验表明,BraveGuard 在轨迹级安全检测上显著优于现有模型,准确率从 38.79% 提升至 82.38%,为应对不断演变的现实风险提供了可扩展路径。
AI 推荐理由
论文提出自我进化防御框架,通过持续挖掘新威胁并迭代训练,实现自适应安全防御。
研究机构
四川大学
蚂蚁集团
论文信息