摘要
大语言模型 Agent 日益通过中间技能层运作,该层介导用户意图与具体任务执行。本文提出 FORTIS 基准,评估 Agent 在技能使用中的过度特权现象:一是模型能否从重叠库中选择最小充分技能;二是执行时是否越权使用更广泛工具。研究发现,跨十个前沿模型和三个领域,过度特权行为是常态而非例外。即使在非对抗性的真实交互条件下,模型也倾向于选择高特权技能,表明技能层本身已成为权限升级的主要来源。
AI 推荐理由
论文核心研究 Agent 技能层中的过度特权问题,评估技能选择与执行边界。
研究机构
University of Southern California
University of Illinois at Urbana-Champaign
论文信息