论文

什么能证伪它?自我解释机制主张的变量特定证据标准

What Would Falsify It? A Variable Specific Evidence Standard for Mechanistic Claims About Self Explanation

模型评测评测方法与指标

摘要

当语言模型解释它已经给出的答案时,它是重用产生答案的计算还是仅根据答案重建故事?归属、可转移性和可恢复性都与因果使用兼容,但无需建立。我们提出了一个证据标准:将每个正统计量与一个变量特定的空值配对,该空值删除了测试变量的身份,同时尽可能匹配相关的滋扰维度,并审核不匹配的维度。我们将此标准应用于已知原因。在三个模型中,指出错误选项的提示会使选择该选项的比率提高 64 至 68 个百分点。在测试的四个模型中,有 3 个模型的解释提到了 1.8% 或更少的项目中的提示。三个估计器类别产生了有利的统计数据,但在三模型分析中,没有一个估计器类别在其自己的控制下建立了对线索对比度的因果敏感性。在最强的情况下,恢复的提示方向达到 0.95 的 $R^2$,并且超过了所有三个种子中与随机方向匹配的几何形状,而由具有扰乱提示标签的相同管道拟合的方向在可比较的实现编辑幅度下再现了其效果的 61% 到 76%。第四个模型通过一个交换端点,但不平等的编辑幅度和改变线索身份和线索-答案一致性的对比度限制了其解释。这些实验没有解决因果关系问题。他们建立了一个证据要求:有利的机械统计数据必须在对可变身份和滋扰结构的控制下幸存下来。可重复使用的控制将通用的传输效应与身份特定的传输效应分开,将零方向与乱序标签相匹配,并审核实现的干预幅度。