Agent Safety Skill Selection Privilege Escalation Benchmark
摘要

大语言模型 Agent 日益通过中间技能层运作,该层介导用户意图与具体任务执行。本文提出 FORTIS 基准,评估 Agent 在技能使用中的过度特权现象:一是模型能否从重叠库中选择最小充分技能;二是执行时是否越权使用更广泛工具。研究发现,跨十个前沿模型和三个领域,过度特权行为是常态而非例外。即使在非对抗性的真实交互条件下,模型也倾向于选择高特权技能,表明技能层本身已成为权限升级的主要来源。

AI 推荐理由

论文核心研究 Agent 技能层中的过度特权问题,评估技能选择与执行边界。

研究机构
University of Southern California University of Illinois at Urbana-Champaign
论文信息
作者 Shawn Li, Chenxiao Yu, Han Wang, Wei Yang, Ryan Rossi et al.
发布日期 2026-05-09
arXiv ID 2605.09163
相关性评分 9/10 (高度相关)