论文
潜在泛化的错觉:双向性和逆转诅咒
The Illusion of Latent Generalization: Bi-directionality and the Reversal Curse
摘要
逆转诅咒描述了自回归语言模型无法以相反的顺序检索事实(例如,在“$A > B$”上进行训练,但在“$B < A$”上失败)。最近的工作表明,具有双向监督的目标(例如,仅解码器模型的双向注意或基于掩蔽的重建)可以减轻逆转诅咒。我们扩展了此评估,以包括普通掩码语言模型(MLM)目标,并将其与跨四个逆转基准的仅解码器基于掩码的训练进行比较,然后提供对这些目标如何成功的最小机制研究。我们表明,反转准确性需要训练信号明确地将源实体作为预测目标,并且我们几乎没有发现证据表明成功对应于事实的单一方向不可知的表示。相反,表示距离和线性探测与将前向和反向方向存储为不同的条目是一致的,MLM 与仅解码器基于掩码的训练具有不同的索引几何结构。我们的结果警告说,客观层面的“修复”可以改善逆转行为,但不一定会引发人们可能期望从统一概念中获得的那种潜在概括。