摘要
针对开源市场中大量 Agent 技能存在安全漏洞且现有工具难以兼顾代码与自然语言指令的问题,本文提出 SkillSieve 三层检测框架。第一层利用轻量级特征过滤大部分良性技能;第二层通过 LLM 并行分析意图、权限及隐蔽行为;第三层采用多模型陪审团机制进行投票与辩论以判定高风险技能。实验表明,该方法在真实数据集上显著优于基线,兼具高准确率与低成本。
AI 推荐理由
论文核心针对 Agent 技能的安全检测,提出分层框架评估技能恶意性,直接关联技能机制。
研究机构
Department of Earth Sciences and Engineering, Imperial College London
Department of Computer Science, University College London
论文信息