Self-Reflection Jailbreak Defense Reinforcement Learning Safety Alignment
摘要

针对大语言模型易受复杂多步间接越狱攻击的问题,本文提出 Reflector 框架。该框架通过两阶段方法将自我反思内化于生成轨迹中:首先利用教师引导生成高质量反思数据进行监督微调,确立结构化反思模式;随后结合结果驱动与奖励有效性监督的强化学习,培养鲁棒的自主反思能力。实验表明,Reflector 在复杂攻击下防御成功率超 90%,并在 GSM8K 等基准测试中显著提升通用效用,为开发安全且强大的 LLM 提供了高效可扩展的解决方案。

AI 推荐理由

论文核心在于通过 RL 内化自我反思机制,实现模型安全能力的自我进化与自适应。

研究机构
Fudan University ShanghAI Artificial Intelligence Laboratory Zhejiang University
论文信息
作者 Jiachen Ma, Jiawen Zhang, Xiangtian Li, Bo Zou, Chaochao Lu et al.
发布日期 2026-05-20
arXiv ID 2605.20654
相关性评分 9/10 (高度相关)