摘要
随着 AI 代理从聊天界面转向处理私有数据及执行多步工作流,防护栏成为防御部署危害的最后防线。针对上下文相关的安全失败及稀疏反馈难题,本文提出 LiSA(终身安全适应)框架。该方法通过结构化记忆改进固定基础防护栏,将偶发失败转化为可复用的策略抽象,引入冲突感知局部规则防止过度泛化,并应用证据感知置信度门控。实验表明,LiSA 在稀疏及噪声反馈下显著优于现有基线,为应对现实世界长尾风险提供了实用路径。
AI 推荐理由
论文提出基于结构化记忆的框架,将失败转化为可复用策略,核心在于记忆机制。
研究机构
Google Cloud AI Research
Seoul National University
论文信息