论文
使用 Transformer 建模计数器语言中堆栈表示的因果证据
Causal Evidence of Stack Representations in Modeling Counter Languages Using Transformers
摘要
事实证明,形式语言是理解 Transformer 内部机制的有效渠道。过去的工作表明,Transformer 通过计数器语言训练下一个词元预测来学习与底层堆栈结构一致的表示。除了表征分析之外,本文还研究了这些表征的因果作用。线性探针经过训练,可以根据模型的隐藏状态预测每个标记的堆栈深度,并从探针中提取主要表示方向。从模型中消除这个方向会导致顺序准确度下降到接近 0%,这提供了强有力的经验证据,表明堆栈表示不仅是学习的,而且对于模型性能来说是因果必要的。