论文
语言模型表示中几何复杂性的局部和全局机制
Local and Global Regimes of Geometric Complexity in Language Model Representations
摘要
内在维度 (ID) 被广泛用于探测语言模型的表示复杂性,但目前尚不清楚 ID 差异是否反映了语言本身的属性或底层数据集构建方式的人为因素。在本文中,我们特别关注词汇多样性(数据集中存在的唯一最后一个标记项的数量)如何影响该数据集的 ID 估计。我们发现两种机制之间存在尺度相关的转变:在低词汇多样性下,具有较少独特最终词的条件会产生较高的 ID,而在高词汇多样性下,这种顺序会相反,并且具有较多独特词的条件会产生较高的 ID。我们针对这种反转发生的点导出了一个精确的、无参数的公式,该公式与在每个测试尺度上观察到的转变点相匹配。一方面,我们的结果强调了在将一组表示的内在维度解释为其复杂性的直接线索时必须小心谨慎。另一方面,我们对两种 ID 机制的发现揭示了 LLM 中语言数据组织的一般原则,为了解它们的内部流形结构提供了新的线索。