摘要
工具调用型文本到图像(T2I)智能体能规划并执行多步工具链以完成复杂任务,但这引入了新的安全攻击面:有害输出可能源于工具编排,即单独无害的步骤组合成不安全结果。本文提出 OrchJail,一种编排引导的模糊测试框架。其核心是利用高风险工具编排模式,通过学习成功越狱的工具调用轨迹及其与提示词的因果关系,直接引导模糊搜索指向更可能触发不安全多步行为的提示,而非依赖表面文本扰动。实验表明,该方法在多个代表性智能体上显著提升了越狱效果与效率。
AI 推荐理由
论文核心研究工具编排(多步规划)引发的安全问题,直接针对 Agent 的任务规划机制。
研究机构
中国科学院软件研究所
论文信息