Agent Safety Skill Verification Code Analysis Behavioral Integrity
摘要

本文提出行为完整性验证(BIV)问题,旨在解决 Agent 技能中声明能力与实际代码实现不一致的安全隐患。通过结合确定性代码分析与 LLM 辅助能力提取,BIV 框架在共享分类法上对比声明与实际能力。对近五万个技能的分析显示,80% 存在偏差,主要源于开发者疏忽而非恶意。该方法在恶意技能检测基准上 F1 值达 0.946,显著优于现有基线,实现了大规模 Agent 技能审计。

AI 推荐理由

论文核心研究 Agent 技能的行为完整性验证,直接针对技能声明与实现的一致性。

研究机构
Palo Alto Networks
论文信息
作者 Yuhao Wu, Tung-Ling Li, Hongliang Liu
发布日期 2026-05-12
arXiv ID 2605.11770
相关性评分 9/10 (高度相关)