LLM Security Red Teaming Reasoning Hijacking Agent Safety
摘要

随着基于大语言模型的智能体在各领域广泛应用,其复杂性引发了新的安全威胁。现有红队方法多依赖修改用户提示词,缺乏对新数据的适应性且可能影响性能。为此,本文提出 JailAgent 框架,完全避免修改用户提示。该框架通过触发提取、推理劫持和约束收紧三个阶段,隐式操纵智能体的推理轨迹与记忆检索。凭借精准的触发识别、实时自适应机制及优化的目标函数,JailAgent 在跨模型和跨场景环境中展现出卓越性能。

AI 推荐理由

论文核心提出“推理劫持”机制,直接操纵 Agent 推理轨迹,属推理能力研究。

研究机构
School of Software, Henan University, China Institute of Information Engineering, Chinese Academy of Sciences, China University of Chinese Academy of Sciences, China Peking University, China
论文信息
作者 Yanxu Mao, Peipei Liu, Tiehan Cui, Congying Liu, Mingzhe Xing et al.
发布日期 2026-04-07
arXiv ID 2604.05549
相关性评分 9/10 (高度相关)