Agent Security Third-party Skills Runtime Trust Benchmark
摘要

第三方技能正成为 LLM Agent 的包生态系统,将指令、脚本及配置封装为可重用工作流,但也引入了新的安全隐患:恶意技能可将有害行为伪装成常规流程,利用 Agent 的高权限执行。本文提出 AgentTrap,一个动态基准,用于评估 Agent 在使用第三方技能时抵抗恶意运行时行为的能力。该基准包含 141 个任务,涵盖 16 个安全维度。研究发现,主要失效模式并非简单越狱,而是模型在完成用户任务时忽略了技能引入的不安全副作用,突显了对实际运行环境进行安全评估的重要性。

AI 推荐理由

论文核心研究第三方技能(skills)的安全性与运行时信任失效,直接针对技能使用机制。

研究机构
University of Notre Dame LMU Munich University of Southern California Inria, France
论文信息
作者 Haomin Zhuang, Hanwen Xing, Yujun Zhou, Yuchen Ma, Yue Huang et al.
发布日期 2026-05-13
arXiv ID 2605.13940
相关性评分 9/10 (高度相关)