摘要
本文针对非受信任的 Agent 技能,提出将预加载审计从单提示过滤转化为跨文件安全审查。作者构建了鲁棒的三方分类任务,并引入 SkillGuard-Robust 框架,结合角色感知证据提取、选择性语义验证及一致性裁决机制。在包含数百个技能包的基准测试中,该方法在恶意风险召回率和攻击一致性方面表现卓越,显著提升了冻结环境及公共生态系统的鲁棒性,证明了模块化包审计的有效性。
AI 推荐理由
论文核心研究 Agent 技能包的安全审计与鲁棒性增强,直接针对技能机制。
研究机构
Institute of Information Engineering, Chinese Academy of Sciences
School of Cyber Security, University of Chinese Academy of Sciences
论文信息