AI Safety Self-Improvement Formal Verification Lipschitz Continuity
摘要

本文实证表明,基于分类器的安全门控无法在 AI 系统数百次迭代自我改进中维持可靠监管。实验显示多种分类器及安全 RL 基线在自改进神经控制器及 MuJoCo 基准上均失效,揭示了结构性不可能。相反,研究提出基于 Lipschitz 球的验证器,利用解析边界实现零误接受,支持无界参数空间遍历。该方法在 MuJoCo 任务及 Qwen2.5 模型微调中实现了显著提升且无安全违规,证明了其在保障 AI 自我进化安全性方面的有效性。

AI 推荐理由

论文核心研究 AI 系统自我改进过程中的安全验证机制,直接解决自我进化中的关键安全问题。

论文信息
作者 Arsenios Scrivens
发布日期 2026-03-31
arXiv ID 2604.00072
相关性评分 9/10 (高度相关)