论文
短行的中心会膨胀词元嵌入的内在维度估计
A Hub of Short Rows Inflates Intrinsic Dimension Estimation of Token Embeddings
摘要
词元嵌入表在其原点附近保留了一个由短行组成的中心,我们表明该簇会偏差最近邻内在维度 (ID) 估计器报告的内容。由于度量的集中,词元比任何其他词元更靠近中心簇,因此它的前两个邻居都是中心行,距离几乎相同。因此,诸如 TwoNN 之类的 ID 估计器返回的维度远高于真实 ID。一次测量一个标记,维度是一种重尾分布。根据完整词汇量进行测量,它随着模型参数数量的增加而增长。然而,当我们移除轮毂时,重尾消失,并且从 GPT-2 到 K3 和 GLM-4.7 等 11 种型号的测量尺寸缩小到一个狭窄的范围。集线器充当开关:几百行足以完全夸大估计值。我们重现了一个实验,指出 Pythia 的词元嵌入表的内在维度 (ID) 随着参数数量的增加而增长,在 160M 和 12B 参数之间从 $27$ 增加到 $122$。我们证明,当中心被移除时,这个结果就会消失:表格中每个尺寸的读数为 $10$ 到 $17$。该集线器包含未训练的词元检测器标记的总体子集,但在 Pythia 上,我们检测到并作为一个整体删除的集线器在训练期间进行了更新:这些行的特征似乎只是它们的长度,而不是缺少更新。最后,我们表明,标准化行而不是删除它们会产生相同的较低读数。