摘要
当前大语言模型对抗测试方法存在覆盖缺口:人工红队难以扩展,基于模型的攻击易出现模式坍塌,而基于梯度的方法生成不可解释的乱码。本文引入一种在语义层面运作的质量 - 多样性进化框架,旨在演化可解释的攻击策略而非令牌序列。利用 MAP-Elites 算法,我们在行为维度(策略类型、编码方式、提示长度)上维护多样化的攻击档案。实验表明,该方法能有效发现不同模型特有的脆弱性特征,生成可解释的攻击案例,为提升大语言模型安全性提供可行见解及可复现的评估基线。
AI 推荐理由
论文提出基于质量多样性的进化框架,核心利用 MAP-Elites 算法演化攻击策略。
研究机构
Research Lead, Rota Labs
论文信息