Agent Security Tool Use Prompt Injection Provenance Tracking
摘要

使用工具的 LLM Agent 需在处理不可信内容时执行特权调用。现有防御多在整次调用层面介导信任,导致混合信任工作流中出现两难困境。本文指出,间接提示注入的危险性在于不可信内容决定了具有权威性的参数。为此,提出 PACT(感知溯源的能力契约),一种运行时监控器,通过分配语义角色、追踪重规划步骤间的值溯源,并检查参数起源是否满足特定信任契约。实验表明,PACT 在强模型上实现了 100% 安全性,同时显著恢复了实用性,优于现有方法。

AI 推荐理由

论文聚焦工具使用中的安全机制,核心在于监控和约束 API 调用参数,属于技能学习的安全子领域。

研究机构
Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China King Abdullah University of Science and Technology, Thuwal, Saudi Arabia Dongbei University of Finance and Economics, Dalian, China University of Science and Technology of China, Hefei, China
论文信息
作者 Linfeng Fan, Ziwei Li, Yuan Tian, Yichen Wang, Rongsheng Li et al.
发布日期 2026-05-11
arXiv ID 2605.11039
相关性评分 8/10 (高度相关)