摘要
随着基于大语言模型的智能体在各领域广泛应用,其复杂性引发了新的安全威胁。现有红队方法多依赖修改用户提示词,缺乏对新数据的适应性且可能影响性能。为此,本文提出 JailAgent 框架,完全避免修改用户提示。该框架通过触发提取、推理劫持和约束收紧三个阶段,隐式操纵智能体的推理轨迹与记忆检索。凭借精准的触发识别、实时自适应机制及优化的目标函数,JailAgent 在跨模型和跨场景环境中展现出卓越性能。
AI 推荐理由
论文核心提出“推理劫持”机制,直接操纵 Agent 推理轨迹,属推理能力研究。
研究机构
School of Software, Henan University, China
Institute of Information Engineering, Chinese Academy of Sciences, China
University of Chinese Academy of Sciences, China
Peking University, China
论文信息