摘要
针对大语言模型智能体工具使用带来的安全风险及现有防御机制过度拒绝的问题,本文提出 SafeHarbor 框架。该框架通过增强对抗生成提取上下文感知的防御规则,并设计局部分层记忆系统实现规则的动态注入,无需训练即可即插即用。此外,引入基于信息熵的自进化机制,通过动态节点分裂与合并持续优化记忆结构。实验表明,该方法在保持高拒绝率的同时显著提升了良性任务的效用。
AI 推荐理由
论文核心提出分层记忆系统与安全规则动态注入机制,属记忆架构研究。
研究机构
School of Cyber Science and Technology, Beihang University, Beijing, China
Institute of Artificial Intelligence, Beihang University, Beijing, China
University of Chinese Academy of Sciences, Beijing, China
AI Security Lab, Beijing, China
论文信息