摘要
本文提出行为完整性验证(BIV)问题,旨在解决 Agent 技能中声明能力与实际代码实现不一致的安全隐患。通过结合确定性代码分析与 LLM 辅助能力提取,BIV 框架在共享分类法上对比声明与实际能力。对近五万个技能的分析显示,80% 存在偏差,主要源于开发者疏忽而非恶意。该方法在恶意技能检测基准上 F1 值达 0.946,显著优于现有基线,实现了大规模 Agent 技能审计。
AI 推荐理由
论文核心研究 Agent 技能的行为完整性验证,直接针对技能声明与实现的一致性。
研究机构
Palo Alto Networks
论文信息