摘要
针对大型语言模型安全分类器易受伪装恶意意图的对抗性越狱攻击问题,本文提出 Reflect-Guard 方法。该方法通过参数高效微调,赋予基于 LLM 的安全分类器思维链自反思能力。研究从 GPT-4o-mini 蒸馏分析推理至结构化反思标注,并利用 QLoRA 训练 Llama-Guard-3-8B 在输出安全判定前生成逻辑反思。实验表明,仅需少量样本和极低参数更新量,该方法在多个基准测试中显著提升了针对对抗性输入的召回率并降低了攻击成功率,证明引导分类器进行意图推理优于表面模式匹配。
AI 推荐理由
论文核心是通过思维链自反思提升安全分类器的逻辑推理能力,以识别对抗性攻击。
研究机构
Yale University, New Haven, CT, USA
Columbia University, New York, NY, USA
Independent Researcher
Citigroup, Dallas, USA
论文信息