论文

表示能力:Transformer 语言模型中特征表示的几何限制

Representational Capacity: Geometric Limits on Feature Representation in Transformer Language Models

模型评测模型行为与机制分析

摘要

模型维度($d_{model}$)是 Transformer 语言模型中的基本超参数,但其在设置特征表示的几何限制方面的作用仍未得到充分探索。基于线性表示和叠加假设(该假设提出模型将特征编码为潜在空间中的近正交方向),我们开发了一个框架来估计模型可以支持多少个此类方向。我们首先建立嵌入矩阵作为潜在空间中近正交性约束的可测量代理:成对余弦相似性分布中有意义的标记关系和偶然相似性之间的边界给出了模型与完美正交性的可接受偏差 $\varepsilon$ 的具体估计。在数十个开源模型中应用此指标揭示了两类:具有高 $\varepsilon$ 且嵌入缺乏近正交结构的模型,以及具有低 $\varepsilon$ 的模型。然后,我们证明标准 Johnson-Lindenstrauss 引理大大低估了训练表示的打包效率,并推导了一个调整后的容量公式,其中近正交方向的数量取决于向量与维度的比率 ($k/d$),而不是原始计数 - 一次修改即可将预测误差减少两个数量级,无需额外参数。结合这些结果,我们将表征能力定义为模型潜在空间中特征和嵌入可用的可区分方向数量的上限。容量对 $\varepsilon$ 呈指数级敏感,较大的模型倾向于更严格的正交约束,而不是最大化原始容量 - 这种模式与我们留给未来工作的多种解释(稳定性与容量权衡、可用概念的上限或与模型规模的混淆)兼容。