Agent Security Skill Auditing Robustness LLM Agents
摘要

本文针对非受信任的 Agent 技能,提出将预加载审计从单提示过滤转化为跨文件安全审查。作者构建了鲁棒的三方分类任务,并引入 SkillGuard-Robust 框架,结合角色感知证据提取、选择性语义验证及一致性裁决机制。在包含数百个技能包的基准测试中,该方法在恶意风险召回率和攻击一致性方面表现卓越,显著提升了冻结环境及公共生态系统的鲁棒性,证明了模块化包审计的有效性。

AI 推荐理由

论文核心研究 Agent 技能包的安全审计与鲁棒性增强,直接针对技能机制。

研究机构
Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences
论文信息
作者 Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu
发布日期 2026-04-28
arXiv ID 2604.25109
相关性评分 9/10 (高度相关)