论文

括号序列中的解离可解码性和因果使用 Transformer

Dissociating Decodability and Causal Use in Bracket-Sequence Transformers

模型评测模型行为与机制分析

摘要

当接受需要理解层次结构的任务训练时,Transformer 被发现以不同的方式表示这种层次结构:在残差流的几何形状中,以及在保持后进先出顺序的堆栈式注意力模式中。然而,目前尚不清楚这些表示是否被因果性地使用或仅仅是可解码的。我们检查了在 Dyck 语言(平衡括号序列的形式语言)上训练的 Transformer 中的这一差距,其中分层 真值 是明确的。通过对残差流和注意力模式的探测和干预,我们发现深度、距离和栈顶信号都是可解码的,但它们的因果作用有所不同。具体来说,掩盖对真实堆栈顶部位置的注意力会导致长距离精度急剧下降,而消除低维残余流子空间的影响相对较小。这些结果扩展到模板化的自然语言设置,表明即使在相关层次变量已知的受控设置中,可解码性本身并不意味着因果使用。