摘要
代理式语言模型系统日益依赖包含文件、记忆、工具及辅助制品的可变执行上下文,这引发了超出显式用户提示的安全风险。本文提出 DeepTrap,一个用于发现 OpenClaw 中上下文漏洞的自动化框架。该方法将对抗性上下文操纵建模为黑盒轨迹级优化问题,平衡风险实现、良性任务保留与隐蔽性。通过构建涵盖六类漏洞和七种场景的 42 案例基准,评估表明上下文妥协可在保持任务完成的同时诱导不安全行为,凸显了以执行为中心的安全评估必要性。
AI 推荐理由
论文核心研究 Agent 可变执行上下文(含记忆、文件等)的安全漏洞,直接涉及记忆机制。
研究机构
Department of Computer Science, City University of Hong Kong, Hong Kong
School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China
University College London, London, England
论文信息