摘要
第三方技能正成为 LLM Agent 的包生态系统,将指令、脚本及配置封装为可重用工作流,但也引入了新的安全隐患:恶意技能可将有害行为伪装成常规流程,利用 Agent 的高权限执行。本文提出 AgentTrap,一个动态基准,用于评估 Agent 在使用第三方技能时抵抗恶意运行时行为的能力。该基准包含 141 个任务,涵盖 16 个安全维度。研究发现,主要失效模式并非简单越狱,而是模型在完成用户任务时忽略了技能引入的不安全副作用,突显了对实际运行环境进行安全评估的重要性。
AI 推荐理由
论文核心研究第三方技能(skills)的安全性与运行时信任失效,直接针对技能使用机制。
研究机构
University of Notre Dame
LMU Munich
University of Southern California
Inria, France
论文信息