LLM Safety Hierarchical Memory Guardrail Self-Evolution
摘要

针对大语言模型智能体工具使用带来的安全风险及现有防御机制过度拒绝的问题,本文提出 SafeHarbor 框架。该框架通过增强对抗生成提取上下文感知的防御规则,并设计局部分层记忆系统实现规则的动态注入,无需训练即可即插即用。此外,引入基于信息熵的自进化机制,通过动态节点分裂与合并持续优化记忆结构。实验表明,该方法在保持高拒绝率的同时显著提升了良性任务的效用。

AI 推荐理由

论文核心提出分层记忆系统与安全规则动态注入机制,属记忆架构研究。

研究机构
School of Cyber Science and Technology, Beihang University, Beijing, China Institute of Artificial Intelligence, Beihang University, Beijing, China University of Chinese Academy of Sciences, Beijing, China AI Security Lab, Beijing, China
论文信息
作者 Zhe Liu, Zonghao Ying, Wenxin Zhang, Quanchen Zou, Deyue Zhang et al.
发布日期 2026-05-07
arXiv ID 2605.05704
相关性评分 9/10 (高度相关)