自我改进系统安全验证的信息论极限
Information-Theoretic Limits of Safety Verification for Self-Improving Systems
摘要
安全门能否允许无限有益的自我修改,同时保持有限的累积风险?我们通过双重条件形式化这个问题——要求总和 delta_n < 无穷大(有界风险)和总和 TPR_n = 无穷大(无界效用)——并建立它们(不)兼容的理论。分类不可能性(定理 1):对于幂律风险表 delta_n = O(n^{-p}) 且 p > 1,重叠安全/不安全分布下的任何基于分类器的门通过 Holder 不等式满足 TPR_n <= C_alpha * delta_n^beta,迫使总和 TPR_n < 无穷大。这种不可能是指数最优的(定理 3)。通过 NP 计数方法(定理 4)进行的第二个独立证明在没有霍尔德不等式的情况下产生了 13% 的紧界。通用有限范围上限(定理 5):对于任何可求和的风险计划,准确的最大可实现分类器效用为 U*(N, B) = N * TPR_NP(B/N),以 exp(O(sqrt(log N))) 形式增长——次多项式。当 N = 10^6 且预算 B = 1.0 时,分类器最多提取 U* ~ 87,而验证器则最多提取 U* ~ 500,000。验证逃逸(定理 2):Lipschitz 球验证器在 TPR > 0 的情况下实现 delta = 0,从而摆脱了不可能。 LoRA 下预 LayerNorm Transformer 的正式 Lipschitz 边界支持 LLM 规模验证。分离是严格的。我们在 GPT-2 (d_LoRA = 147,456) 上进行验证:条件 delta = 0,TPR = 0.352。配套论文 [D2] 中有全面的实证验证。