论文
见所未见:论Transformer在符号推理中的泛化能力
To See the Unseen: on the Generalization Ability of Transformers in Symbolic Reasoning
摘要
我们研究decoder-only transformer模型执行抽象符号推理的能力,具体是求解以上下文形式给出的命题逻辑推理问题。先前的工作表明,模型无法泛化到包含训练中未见过的变量名的问题,并证明其原因之一是复制(或生成)未见token的困难。我们从理论和实证两方面表明,一种特定的表征坍缩也起着关键作用:未见token的unembedding(最后一层权重)在训练过程中坍缩到几乎相同的向量。这种坍缩使模型难以区分多个未见变量(尤其在embedding与unembedding参数共享时),并为"主动遗忘"(active forgetting)这类现有启发式干预的有效性提供了机制性解释——该干预周期性地重置token的(un)embedding。基于这些观察,我们设计了一组技术组合,包括一个便于复制的小型架构改动、数据多样性,以及冻结或重置(un)embedding,从而实现对未见token的泛化。我们通过在命题逻辑推理问题上的大量受控实验支持上述主张。在合成实验之外,我们还在Gemma 3系列开放权重模型中观察到(un)embedding坍缩的证据,该系列包含99个为下游使用预留的未使用token。实证上我们发现,这些token彼此相关的embedding作为微调初始化的效果很差。
