论文

见所未见:论Transformer在符号推理中的泛化能力

To See the Unseen: on the Generalization Ability of Transformers in Symbolic Reasoning

模型评测模型行为与机制分析

摘要

我们研究decoder-only transformer模型执行抽象符号推理的能力,具体是求解以上下文形式给出的命题逻辑推理问题。先前的工作表明,模型无法泛化到包含训练中未见过的变量名的问题,并证明其原因之一是复制(或生成)未见token的困难。我们从理论和实证两方面表明,一种特定的表征坍缩也起着关键作用:未见token的unembedding(最后一层权重)在训练过程中坍缩到几乎相同的向量。这种坍缩使模型难以区分多个未见变量(尤其在embedding与unembedding参数共享时),并为"主动遗忘"(active forgetting)这类现有启发式干预的有效性提供了机制性解释——该干预周期性地重置token的(un)embedding。基于这些观察,我们设计了一组技术组合,包括一个便于复制的小型架构改动、数据多样性,以及冻结或重置(un)embedding,从而实现对未见token的泛化。我们通过在命题逻辑推理问题上的大量受控实验支持上述主张。在合成实验之外,我们还在Gemma 3系列开放权重模型中观察到(un)embedding坍缩的证据,该系列包含99个为下游使用预留的未使用token。实证上我们发现,这些token彼此相关的embedding作为微调初始化的效果很差。

见所未见:论Transformer在符号推理中的泛化能力:论文配图
图 4:99 个未使用的标记和 100 个随机选择的标记的嵌入之间的余弦相似度。在所有模型中,未使用的标记比已使用的标记相关性更强,嵌入维数越小,效果越明显。图 5:针对具有与未使用标记、英语形容词和字母相对应的谓词的逻辑问题微调 Gemma 3 1B IT 时的准确性。曲线对应于随机种子。对于形容词和字母,准确率在大约 500 个微调步骤中达到 90%,而对于未使用的标记,达到 90% 的准确率需要大约 5000 个步骤,这可能是嵌入崩溃的产物。