论文

语言模型中的柏拉图式表征理论

A theory of platonic representations in language models

模型评测模型行为与机制分析

摘要

翻译句子的表示在多语言语言模型的内层中是相似的——这一观察与柏拉图表示假说相关,但在理论上尚未解释。我们基于以下假设提供解释:数据具有隐藏的层次结构,其抽象级别在不同语言之间共享,而表面级别是特定于模态或特定于语言的。具体来说,我们从共享上层但不共享下层产生规则的概率上下文无关语法生成合成语言。在此设置中,贝叶斯最优的下一个 token 预测器是置信传播 (BP);在连续层中编码其消息会产生与在相同数据上训练的Transformer非常一致的分析预测。该框架解释了为什么跨语言相似性在中间层达到峰值,与特定于语言的结构共存,并随着语言的接近性、模型质量和数据暴露而增强。它将相似性(共享邻域几何)与对齐(共享坐标)区分开来,表明后者在代码转换数据(即混合语言句子)足够丰富时发生。它进一步预测,从每一层中减去前一层可线性预测的组件会增加跨语言相似性,我们在预训练的 LLM 中证实了这一点。

语言模型中的柏拉图式表征理论:论文原图
图 1:(a) 多语言随机层次结构模型。上层产生式规则在语言之间共享,而下层规则是特定于语言的。锯齿线表示这种分离。混合句子是通过替换特定于语言的子树生成的。 (b) 通过置信传播 (BP) 推理进行最优的 next-token 预测。编码:从$t$观察到token,对越来越高的潜在变量的信念被顺序计算并向上传播。突出显示的节点表示编码的信念,划线的框表示计算。解码:使用编码信息迭代计算潜在变量的后验概率,向着越来越低的水平,最终得到第 $(t+1)$ 个 token 的概率。根据这个精确的算法,构建了一个理论网络,其分层表示对 BP 算法的步骤进行编码。 $L_{\mathrm{surface}}$ 以下的计算是特定于语言的,而 $L_{\mathrm{surface}}$ 以上的计算具有共享组件。这导致了理论网络中心附近的最大跨语言相似性,这在经过训练的Transformer中得到了证实。详细信息请参见第 4 节。 (c) 使用信息不平衡衡量的跨语言相似性(其中较低的信息不平衡对应于较高的相似性,参见附录 D)。 OLMo-3-7B 在英语和波兰语上进行了测试(Team Olmo 等人,2026),在多语言 RHM 数据上训练的 Transformer 以及使用 BP 构建的理论网络 - 都表现出相似的 II 配置文件,其中中间层的相似性最强。