self-improvement safety verification information theory LLM safety
摘要

本文探讨了安全网关能否在维持有界累积风险的同时,允许无限的有益自我修改。通过形式化双重条件(风险有界且效用无限),建立了二者相容性的理论。研究证明了基于分类器的网关在特定风险调度下存在不可能性定理,即无法同时满足无限效用与有界风险。然而,提出了一种基于 Lipschitz 球验证器的方法,能够实现零风险下的正真阳性率,从而突破该限制,并在 GPT-2 上进行了实证验证。

AI 推荐理由

论文核心研究自我改进系统的安全验证理论界限,直接针对 Agent 自我进化中的风险控制与效用平衡问题。

论文信息
作者 Arsenios Scrivens
发布日期 2026-03-30
arXiv ID 2603.28650
相关性评分 9/10 (高度相关)