摘要
本文实证表明,基于分类器的安全门控无法在 AI 系统数百次迭代自我改进中维持可靠监管。实验显示多种分类器及安全 RL 基线在自改进神经控制器及 MuJoCo 基准上均失效,揭示了结构性不可能。相反,研究提出基于 Lipschitz 球的验证器,利用解析边界实现零误接受,支持无界参数空间遍历。该方法在 MuJoCo 任务及 Qwen2.5 模型微调中实现了显著提升且无安全违规,证明了其在保障 AI 自我进化安全性方面的有效性。
AI 推荐理由
论文核心研究 AI 系统自我改进过程中的安全验证机制,直接解决自我进化中的关键安全问题。
论文信息