论文

更拒斥而非更判别:预执行LLM监督中的验证单元

More Rejective, Not More Discriminative: The Unit of Verification in Pre-Execution LLM Oversight

模型评测评测方法与指标

摘要

预执行监督是AI控制中可信监控的核心:一个可能出错的LLM监控器在不可逆执行之前审查计划中的行动。过度阻断会损失有用性,并迫使部署者禁用它。每个协议都必须固定一个验证单元:一次调用审查多少行动。现有设计将单元视为给定;它对可能出错的监控器的影响未被测量。自然轨迹无法隔离它:审查长度与错误类型和位置共变。只看捕获率会误导:拒绝一切就能捕获一切。测量它需要仅变化边界和一个匹配的干净对照。我们提出双前缀(twin-prefix)框架,同时提供两者。每个黄金计划产生一个带有一个被注入、被环境接受错误的前缀,以及一个仅在一处写入不同的干净孪生前缀。在五个嵌套长度下对每一对进行判断,将判定变化仅归因于验证单元。判别力由预注册的informedness(知情度)评分:捕获减去误拒。更长的审查提高捕获率;误拒率同步攀升。在两个领域中,所有六名评委的informedness都在一到两个行动处达到峰值:更长的窗口使零样本监控器更拒斥,而非更判别。重放保留的观察追溯这一失败主要源于观察剥夺。安全案例应声明验证单元并同时报告干净序列。我们的框架是首个针对此选择的受控、预注册工具,且从不单独读取捕获率。我们校准的短单元相比八行动审查可恢复高达0.95的informedness,且没有测试过的标签盲策略能持续胜过它。

更拒斥而非更判别:预执行LLM监督中的验证单元:论文配图
图A1:按错误位置统计的捕获情况热力图(空白单元格:结构上不可行的位置)。窗口内部是一个盲区,且随验证器减弱而加深;AppWorld的深层锚点使位置1可达,14B在L=8处对该位置的捕获率恰为0。