摘要
随着代理式 AI 的发展,旨在通过调用外部函数扩展能力的函数调用大语言模型备受关注。本文提出了一种新型函数劫持攻击(FHA),通过操纵代理模型的工具选择过程,强制其调用攻击者指定的函数。现有攻击多关注语义偏好,而 FHA 对上下文语义不敏感且鲁棒性强,适用于多样领域。实验表明,该攻击可生成通用对抗函数,在五个不同模型上实现了 70% 至 100% 的攻击成功率,揭示了代理系统亟需强化安全防护机制。
AI 推荐理由
论文核心研究 Agent 函数调用(工具使用)机制的安全漏洞,直接针对技能执行过程。
研究机构
IBM Research Europe
Trinity College Dublin
Imperial College London
论文信息