论文

语言模型中共享句法机制的细粒度分析

Fine-Grained Analysis of Shared Syntactic Mechanisms in Language Models

模型评测模型行为与机制分析

摘要

虽然语言模型表现出复杂的句法功能,但其内部机制与语言学研究的交叉构造原理的一致程度仍然知之甚少。本研究通过在粒度级别应用因果解释方法来调查模型是否在不同句法结构中采用共享神经机制。专注于填充间隙依赖性和负极性项目 (NPI) 许可,我们利用激活修补来识别特定注意头和 MLP 块的功能角色。我们的结果揭示了位于早期到中间层的填充间隙依赖性的高度本地化和共享的机制,而 NPI 处理没有表现出这种统一的机制。此外,我们发现这些通过激活修补识别的机制可推广到分布外,而分布式对齐搜索(一种监督可解释性方法)很容易在狭窄的语言分布上过度拟合。最后,我们通过证明对已识别组件的操作提高了模型在可接受性判断基准上的性能来验证我们的发现。