self-recovery reinforcement learning safety alignment adversarial robustness
摘要

大型推理模型虽具备通用自我修正能力,但在对抗攻击下难以从不安全推理轨迹中恢复。现有对齐方法依赖静态专家数据,无法覆盖模型动态生成的广阔空间。为此,本文提出 Self-ReSET,一种纯强化学习框架,旨在赋予大型推理模型从自身安全错误轨迹中内在恢复的能力,并将这些轨迹重用为强化学习的初始状态。实验表明,该方法显著提升了模型对对抗攻击(尤其是分布外越狱提示)的鲁棒性,同时保持通用效用并高效利用数据,有效培养了模型识别并从中间错误状态回归良性路径的自我恢复模式。

AI 推荐理由

论文提出纯强化学习框架,使模型能从自身错误轨迹中自我恢复,属于典型的自我进化与自适应机制。

研究机构
中国科学院大学
论文信息
作者 Dongcheng Zhang, Yi Zhang, Yuxin Chen, An Zhang, Xiang Wang et al.
发布日期 2026-05-09
arXiv ID 2605.08936
相关性评分 9/10 (高度相关)