论文

在相信其结论之前先校准可解释性仪器

Calibrating Interpretability Instruments Before Trusting Their Verdicts

模型评测评测方法与指标

摘要

关于大语言模型 (LLM) 内部结构的因果声明依赖于测量。这些可能包括投影、余弦、消融增量或交换补丁等。这些测量以特定的、可诊断的方式失败,返回一个可信的数字而不是错误,因此损坏的仪器可以轻松地读取为结果。协方差匹配的空值可能会饱和,直到每个方向看起来都很典型,每个头的归因可能会在重新排序的归一化架构上超出真实残差写入三倍,交换补丁可能会变得符号混乱,因为其结果被固定在上限,或者读取的判决可能是测量超过模型已决定的层的工件。本说明记录了关于拒绝和道德表征的因果解释性计划中的六次此类失败,涵盖多篇论文和一个四模型开放权重小组;每种模式都建立在四种模式中的一种或两种之上。对于每一个,我们都给出捕获它的信号和一个以可检测触发器为关键的协议(重新排序的标准化、大规模激活、低维决策通道),这样我们和读者就可以检查给定的设置是否被暴露。该规则减少为四个步骤:根据正控制阶梯进行校准,使用正交单元进行验证,在花费计算之前计算能力,以及在参考模型承诺的深度上陈述每个读取的判决。证据是单个程序中跨三个系列的四种架构;跨程序的外部复制是未来的工作。