摘要
自动化平台日益集成大语言模型代理以执行代码审查等任务,但这引入了新的安全风险:攻击者可构造特定输入操纵代理执行恶意操作。本文提出了首个检测与利用框架 JAW,通过一种名为“上下文引导进化”的新方法劫持代理工作流。该方法结合混合程序分析生成的上下文(包括静态路径可行性、动态提示来源及能力分析),演化工作流输入以实现劫持。在 GitHub 和 n8n 上的评估显示,数千个工作流可被成功劫持以泄露凭证。研究结果已披露给相关厂商并获修复。
AI 推荐理由
论文提出“上下文引导进化”方法攻击 Agent,核心涉及输入进化机制,虽侧重安全但紧密关联自我进化概念。
研究机构
Johns Hopkins University Applied Physics Lab, Maryland, USA
Johns Hopkins University, Maryland, USA
Wyze Labs, Washington, USA
论文信息