Agent Safety Skill Invocation Risk Assessment Prompt Injection
摘要

自主语言模型代理日益依赖可安装技能完成任务。静态审计无法判断特定请求下的调用安全性。本文提出 STARS 框架,将技能调用审计视为连续风险估计问题,结合静态能力先验、请求条件化风险模型及校准风险融合策略。通过构建包含 3000 条记录的 SIA-Bench 基准测试,实验表明该方法在间接提示注入攻击检测中显著优于静态基线,证明请求条件化审计更适合作为调用时的风险评分与分流层,而非替代静态筛查。

AI 推荐理由

论文核心研究 Agent 技能调用的安全审计与风险评估机制,直接针对技能使用场景。

研究机构
深圳大学 King Abdullah University of Science & Technology PRADA Lab University of Georgia
论文信息
作者 Guijia Zhang, Shu Yang, Xilin Gong, Di Wang
发布日期 2026-04-11
arXiv ID 2604.10286
相关性评分 9/10 (高度相关)