论文

ObserverBench:测试干预和控制的机制估计

ObserverBench: Testing Mechanistic Estimates for Intervention and Control

模型评测评测方法与指标

摘要

机械可解释性越来越多地用于指导激活转向、电路移除和安全监控等干预措施。然而,平均而言准确的内部估计仍然可能会选择糟糕的行动。我们提出了 ObserverBench,这是一个基准框架,用于测试内部估计器(观察者)是否足以执行其指示的干预、控制或安全任务。每个任务都会修复模型、信息边界、允许的操作、决策规则、保留案例和损失。基准测试将估计准确性与所选操作造成的损失分开报告。理论和实验说明了为什么两者都需要。在闭环控制中,观察者误差在起点和允许干预可以到达的方向上很重要。在 GPT-2-small 和 Qwen2.5-7B 的电路干预任务中,成对观察者可以更准确地预测看不见的影响,而不必总是选择更好的行动;受过动作损失训练的观察者会选择损失较低的动作。在安全分类中,当违规行为具有不同的成本时,完美区分违规行为的分数可能会很差地分配固定干预预算。在 Qwen2.5-7B、Gemma-2-9B-it 和预期冻结的 Qwen3.5-9B APPS 任务中,AUROC 可以根据部署损失对监视器进行不同的排名,并且最佳信息源会随着模型的变化而变化。在公开的激活密度或检查点不匹配的情况下,稀疏 SAE 读数也在报告的 Qwen 面板上跟踪其层匹配的密集控制。 ObserverBench 提供固定任务契约、可运行基线和基于表格的提交,用于通过它们启用的操作来评估可解释性方法。