论文

重温语言中的各向异性 Transformer:学习动态的几何

Revisiting Anisotropy in Language Transformers: The Geometry of Learning Dynamics

模型评测模型行为与机制分析

摘要

自推出以来,Transformer 架构一直主导着自然语言处理 (NLP)。然而,最近的研究强调了这些模型中固有的各向异性现象,对其几何解释提出了重大挑战。先前对这种现象的理论研究很少以底层的表示几何为基础。在本文中,我们通过推导出频率偏置采样如何减弱曲率可见性以及为什么训练优先放大切线方向的几何参数来扩展它们。根据经验,我们然后在训练期间而不是事后使用基于概念的机械可解释性来拟合激活派生的低秩切线代理,并根据普通反向传播的真实梯度对其进行测试。在编码器式和解码器式语言模型中,我们发现这些激活派生的方向捕获了异常大的梯度能量和比匹配秩正常控制更大的梯度各向异性份额,为各向异性的切线对齐解释提供了强有力的经验支持。