论文
过度可分离性:用于基准污染检测的干扰控制残余流探测
Excess Separability: Nuisance-Controlled Residual-Stream Probing for Benchmark Contamination Detection
摘要
基准污染是通过 n-gram 重叠、基于可能性的成员推理或金丝雀字符串来诊断的,每个都需要一些通常不可用的东西:训练语料库、精心选择的测试统计数据或发布时的预见。最近的替代方案是从内部激活的线性探针中读取它。我们证明了执行此操作的自然方法不起作用,指定一种在测量中幸存下来的方法,然后发现使其起作用的校正比其测试的零值具有更多的方差。该协议报告了探针精度深度剖面的零和对比,在水平匹配的安慰剂基线上进行了重新调整,针对标签排列无效进行了测试,参考集的大小是可疑集的两倍。每个选择都取代了我们在测量中拒绝的更简单的选择。报告过度可分离性的水平而不是其形状,使得误报率跟踪分析师自己的控制集的大小,在真实零值下为 0.03 到 0.99。与平坦的深度剖面相比,当表面可解码性随深度增加而增加时,拒绝真正的零值 0.72,并在其下降时失去所有功率。在真实的 Transformer 上,协议未通过模拟未进行的测试。新近环减去估计值,排列空值使其保持固定。对受污染检查点的四次审核中的分裂种子进行重新估计,其标准差是每个臂中零值本身的 1.30 至 1.56 倍:为消除偏差而减去的内容比其纠正的内容更具可变性。一旦传播方差,名义上显着的结果 p = 0.0075 将变为 0.0745,并且不会发布任何结论。模拟忽略了这一点,因为它们的表面关键是协变量驱动项目变化;在真实文本中,它是一个代理,并且在模拟中降低关键质量会再现它。我们添加一个伴随测量和一个加宽的零值。没有手臂显示出污染。