Agent Safety Tool Use Runtime Interception Security
摘要

现代 AI 代理通过文件操作、Shell 命令等工具调用产生现实世界影响,单一不安全行为即可造成不可逆损害。现有防御存在滞后性或无法理解上下文语义。本文提出 AgentTrust,一种运行时安全层,能在执行前拦截工具调用并返回结构化裁决(允许、警告、阻止或审查)。该系统结合 Shell 去混淆规范化、安全修复建议、多步攻击链检测及缓存感知的大模型评判机制。在包含 930 个场景的基准测试中,AgentTrust 展现了高准确率与低延迟,有效防御混淆载荷,并为兼容 MCP 协议的代理提供安全支持。

AI 推荐理由

论文核心研究 Agent 工具调用的运行时安全拦截与评估,直接针对技能执行机制。

研究机构
Independent Researcher
论文信息
作者 Chenglin Yang
发布日期 2026-05-06
arXiv ID 2605.04785
相关性评分 9/10 (高度相关)