论文

因果吊桥:表征 Transformer LM 中句法岛的梯度阻塞

Causal Drawbridges: Characterizing Gradient Blocking of Syntactic Islands in Transformer LMs

模型评测模型行为与机制分析

摘要

我们展示了 Transformer 模型中的因果干预如何通过关注句法理论的长期挑战:句法岛来提供对英语语法的见解。从协调动词短语中提取的内容通常会被降级,但可接受性随着词汇内容的不同而逐渐变化(例如,“我知道他讨厌艺术和喜欢什么”与“我知道他低头看到了什么”)。我们证明现代 Transformer 语言模型在这个梯度上复制了人类的判断。使用因果干预措施来隔离 Transformer 块、注意力模块和 MLP 中功能相关的子空间,我们证明从协调岛中提取采用与规范 wh 依赖相同的填充间隙机制,但这些机制在不同程度上被选择性地阻止。通过将大量不相关的文本投影到这些因果识别的子空间上,我们得出了一个新颖的语言假设:连词“and”在可提取结构和不可提取结构中的表示方式不同,对应于编码关系依赖性与纯粹连词使用的表达。这些结果说明了机械可解释性如何影响语法,从而产生关于语言表示和处理的新假设。