Agent Security Semantic Fuzzing Skill Verification Specification Violation
摘要

LLM 驱动的 Agent 可能因调用的技能违背其自身声明的安全规则而执行危险操作,这种现象被称为“规范违反”。此类问题源于自然语言护栏语义未定义或实现忽略约束,传统防御手段难以检测。本文提出 Sefz,一种目标导向的语义模糊测试框架,通过将护栏转化为执行轨迹上的可达性目标,利用基于 LLM 的变异器和多臂老虎机算法自动生成逼近违规模式的 benign 输入。在 402 个真实技能测试中,Sefz 发现了 120 起违规事件,揭示了六类常见设计缺陷。

AI 推荐理由

论文核心研究 Agent 技能(Skill)的安全规范违反问题,提出针对技能执行的模糊测试框架。

研究机构
University of California, Los Angeles University of California, Santa Barbara
论文信息
作者 Ying Li, Hongbo Wen, Yanju Chen, Hanzhi Liu, Yuan Tian et al.
发布日期 2026-05-13
arXiv ID 2605.13044
相关性评分 9/10 (高度相关)