监督差距:LLM 安全监控器遗漏了什么,以及为什么它不是能力
The Oversight Gap: What LLM Safety Monitors Miss, and Why It Is Not Capability
摘要
多个物业安全监察员被要求进行认证,其中跨租户互不干扰、沙袋和评估意识是二级安全超级物业,仅经过两次执行见证。标准结果是二元不可能性:一条痕迹无法决定它们。我们用测量值替换二进制。紧界将任何单迹监测器的平衡精度置于 $\tfrac12+\tfrac12\,TV(P_0,P_1)$,将不可判定性转变为分级可检测性边界,并定义监督差距:监测器低于其的不足。在具有封闭形式 $TV$ 的泄漏系列中,九个 LLM 监视器在 $TV=0$ 时最佳,但随着 $TV$ 的增长捕获很少的信号;在 $TV=1$ 时,20 行会员检查得分为 100\%$,平均为 60.9\%$。这种不足主要不是能力:命名要检查的内容会关闭其中的 $61\%$,同时留下 $TV=0$ 控制机会。相同的分割运行通过 $2{\times}2$ 阶乘:想象的第二次运行让监视器有机会($50.4\%$),而执行的第二次运行的相同规则达到 $90.0\%$,并且没有比较过程的存储预言仅产生 $68.2\%$。信息和程序都是必要的,而能力也不是。在非确定性下,重放仅在正确的投影下跟踪闭合形式的 $k$-重放曲线,并且投影边界显示所产生的困境是被迫的:渠道外泄漏的狭窄遗漏 $98.6\%$,干净流量的广泛标记 $75.7\%$,并且可达到的精度在良性变化率和通道计数中衰减为 $1/(qm)$。最后,两位前沿 LLM 法官认证了我们自己的基准测试的早期版本是合理的,而符号测试发现了方向偏差 ($p=2.7\times10^{-5}$),这使得我们的三个发现无效。超级房地产基准的构建有效性应该通过机械方式证明,而不是通过模型审核。