摘要
针对多模态大模型在上下文安全性方面的脆弱性,本文提出了 MM-SafetyBench++基准,用于评估模型区分细微语境差异的能力。此外,介绍了 EchoSafe 框架,这是一种无需训练的解决方案,通过维护自反思记忆库来积累和检索过往交互中的安全洞察。该机制将相关历史经验整合至当前提示中,使模型能够在推理阶段实现基于上下文的安全推理及安全行为的持续进化。实验表明,该方法在多个基准上均取得了优越性能。
AI 推荐理由
论文提出自反思记忆库机制,核心在于利用记忆实现安全行为的持续进化与上下文感知。
研究机构
机器人研究所,卡内基梅隆大学
论文信息