摘要
自主语言模型代理日益依赖可安装技能完成任务。静态审计无法判断特定请求下的调用安全性。本文提出 STARS 框架,将技能调用审计视为连续风险估计问题,结合静态能力先验、请求条件化风险模型及校准风险融合策略。通过构建包含 3000 条记录的 SIA-Bench 基准测试,实验表明该方法在间接提示注入攻击检测中显著优于静态基线,证明请求条件化审计更适合作为调用时的风险评分与分流层,而非替代静态筛查。
AI 推荐理由
论文核心研究 Agent 技能调用的安全审计与风险评估机制,直接针对技能使用场景。
研究机构
深圳大学
King Abdullah University of Science & Technology
PRADA Lab
University of Georgia
论文信息