摘要
针对大语言模型易受复杂多步间接越狱攻击的问题,本文提出 Reflector 框架。该框架通过两阶段方法将自我反思内化于生成轨迹中:首先利用教师引导生成高质量反思数据进行监督微调,确立结构化反思模式;随后结合结果驱动与奖励有效性监督的强化学习,培养鲁棒的自主反思能力。实验表明,Reflector 在复杂攻击下防御成功率超 90%,并在 GSM8K 等基准测试中显著提升通用效用,为开发安全且强大的 LLM 提供了高效可扩展的解决方案。
AI 推荐理由
论文核心在于通过 RL 内化自我反思机制,实现模型安全能力的自我进化与自适应。
研究机构
Fudan University ShanghAI Artificial Intelligence Laboratory
Zhejiang University
论文信息