人工智能安全门分类验证二分法的实证验证
Empirical Validation of the Classification-Verification Dichotomy for AI Safety Gates
摘要
随着人工智能系统经过数百次迭代改进,基于分类器的安全门能否保持可靠的监督?我们提供了全面的经验证据证明他们不能。在自我改进的神经控制器 (d=240) 上,十八种分类器配置——涵盖 MLP、SVM、随机森林、k-NN、贝叶斯分类器和深度网络——都无法满足安全自我改进的双重条件。三个安全 RL 基线(CPO、Lyapunov、安全屏蔽)也失败。结果扩展到 MuJoCo 基准(Reacher-v4 d=496、Swimmer-v4 d=1408、HalfCheetah-v4 d=1824)。在控制分布分离达到 delta_s=2.0 时,所有分类器仍然失败——包括 NP 最优测试和训练准确度为 100% 的 MLP——这证明了结构上的不可能性。然后我们证明这种不可能性是分类所特有的,而不是安全的自我改进本身。 Lipschitz 球验证器使用可证明的分析边界(无条件 delta=0)在 {84, 240, 768, 2688, 5760, 9984, 17408} 中的维度 d 上实现零错误接受。球链实现了无界参数空间遍历:在 MuJoCo Reacher-v4 上,10 条链在 delta=0 时产生 +4.31 的奖励改进;在 LoRA 微调 期间的 Qwen2.5-7B-Instruct 上,42 个链转换穿过 234 倍单球半径,在 200 个步骤中安全违规为零。 50 条提示的预言证实了预言的不可知性。每组成分验证使半径比全网络球大 37 倍。当d<=17408时,delta=0是无条件的;在 LLM 尺度,以估计的 Lipschitz 常数为条件。