论文

收敛进化:不同的语言模型如何学习相似的数字表示

Convergent Evolution: How Different Language Models Learn Similar Number Representations

模型评测模型行为与机制分析

摘要

在自然文本上训练的语言模型学习使用主导周期为 $T=2, 5, 10$ 的周期特征来表示数字。在本文中,我们确定了这些特征的两层层次结构:虽然 Transformer、线性 RNN、LSTM 和以不同方式训练的经典词嵌入都学习在傅里叶域中具有周期 $T$ 尖峰的特征,但只有一些学习可用于对数字 mod-$T$ 进行线性分类的几何可分离特征。为了解释这种不协调性,我们证明傅里叶域稀疏性对于 mod-$T$ 几何可分离性是必要的,但还不够。根据经验,我们研究了 模型训练 何时产生几何可分离的特征,发现数据、架构、优化器和分词器都发挥着关键作用。特别是,我们确定了模型获取几何可分离特征的两种不同途径:它们可以从通用语言数据中的互补共现信号(包括文本数字共现和跨数字交互)或从多标记(但不是单标记)加法问题中学习这些特征。总的来说,我们的结果强调了特征学习中的收敛进化现象:各种模型从不同的训练信号中学习相似的特征。