摘要
多模态智能体常因视觉幻觉导致未授权的工具调用,将回答质量错误转化为安全失效。本文形式化该问题为“幻觉到动作的转换”,并提出携带证据的多模态智能体(ECA)。ECA 将模型自由文本视为不可信证据,通过将工具调用分解为关键谓词,利用受限的 DOM/OCR 验证器获取类型化证书,仅当证书支持时才授予执行权限。实验表明,该方法在多种攻击场景下显著降低了不安全动作率,实现了从模型提议到外部证据授权的范式转变。
AI 推荐理由
论文核心研究多模态 Agent 的工具调用安全机制,提出证据携带架构以防止幻觉触发错误操作。
研究机构
深圳大学
HKUST
论文信息