摘要
LLM 驱动的 Agent 可能因调用的技能违背其自身声明的安全规则而执行危险操作,这种现象被称为“规范违反”。此类问题源于自然语言护栏语义未定义或实现忽略约束,传统防御手段难以检测。本文提出 Sefz,一种目标导向的语义模糊测试框架,通过将护栏转化为执行轨迹上的可达性目标,利用基于 LLM 的变异器和多臂老虎机算法自动生成逼近违规模式的 benign 输入。在 402 个真实技能测试中,Sefz 发现了 120 起违规事件,揭示了六类常见设计缺陷。
AI 推荐理由
论文核心研究 Agent 技能(Skill)的安全规范违反问题,提出针对技能执行的模糊测试框架。
研究机构
University of California, Los Angeles
University of California, Santa Barbara
论文信息