Safety Guardrails Lifelong Learning Structured Memory Agent Safety
摘要

随着 AI 代理从聊天界面转向处理私有数据及执行多步工作流,防护栏成为防御部署危害的最后防线。针对上下文相关的安全失败及稀疏反馈难题,本文提出 LiSA(终身安全适应)框架。该方法通过结构化记忆改进固定基础防护栏,将偶发失败转化为可复用的策略抽象,引入冲突感知局部规则防止过度泛化,并应用证据感知置信度门控。实验表明,LiSA 在稀疏及噪声反馈下显著优于现有基线,为应对现实世界长尾风险提供了实用路径。

AI 推荐理由

论文提出基于结构化记忆的框架,将失败转化为可复用策略,核心在于记忆机制。

研究机构
Google Cloud AI Research Seoul National University
论文信息
作者 Minbeom Kim, Lesly Miculicich, Bhavana Dalvi Mishra, Mihir Parmar, Phillip Wallis et al.
发布日期 2026-05-14
arXiv ID 2605.14454
相关性评分 9/10 (高度相关)