Agent Security Skill Detection LLM Evaluation Prompt Injection
摘要

针对开源市场中大量 Agent 技能存在安全漏洞且现有工具难以兼顾代码与自然语言指令的问题,本文提出 SkillSieve 三层检测框架。第一层利用轻量级特征过滤大部分良性技能;第二层通过 LLM 并行分析意图、权限及隐蔽行为;第三层采用多模型陪审团机制进行投票与辩论以判定高风险技能。实验表明,该方法在真实数据集上显著优于基线,兼具高准确率与低成本。

AI 推荐理由

论文核心针对 Agent 技能的安全检测,提出分层框架评估技能恶意性,直接关联技能机制。

研究机构
Department of Earth Sciences and Engineering, Imperial College London Department of Computer Science, University College London
论文信息
作者 Yinghan Hou, Zongyou Yang
发布日期 2026-04-08
arXiv ID 2604.06550
相关性评分 9/10 (高度相关)