论文

坍缩之前的结构:下一词元预测中的短暂语义几何

Structure Before Collapse: Transient semantic geometry in next-token prediction

模型评测模型行为与机制分析

摘要

Neural Collapse 预测平衡的 one-hot 分类会使模型表示彼此相距同样远;仅依赖于输出标签并忽略输入中的任何语义相似性的对称配置。这就产生了一个难题:下一个标记预测语言模型主要使用单热标签进行训练(随着上下文长度的增加):相同的上下文在使用不同标签的训练中不太可能出现两次。然而,他们清楚地学习了潜在的结构特征。也就是说,尽管采用了 one-hot 训练机制,但语言模型的上下文嵌入代表了这样一个事实:“Mary Break the ___”中的下一个单词很可能由 a) 中等大小、b) 刚性、c) 无生命名词的潜在类别中的标记填充。当共现统计崩溃为单热稀疏性时,梯度下降如何找到这种分类语义结构,从而消除不同上下文之间的任何共享的下一个标记?为了研究这种张力,我们确定了三种综合控制设置,其中输入具有潜在语义因素,但映射到不同的单热标签。我们发现语义几何在训练的早期就出现了,并且尽管没有受到明确的监督,但表示还是通过共享属性进行聚类。这种结构是暂时的:在足够的容量和时间下,模型最终达到预测的对称状态,其中所有表示均等分离。我们通过格拉姆矩阵分析研究这种相变,并对常用的无约束特征模型提出初步修改,以捕获新出现的语义几何。