论文

通过Identity Bridge打破自回归语言模型的逆转咒语

Breaking the Reversal Curse in Autoregressive Language Models via Identity Bridge

模型训练合成数据

摘要

自回归大语言模型(LLM)在许多复杂任务上取得了显著成功,但仍可能在非常简单的逻辑推理上失败,例如“逆转咒语”(reversal curse)——当模型在形如“A → B”的前向知识数据(如Alice的丈夫是Bob)上训练后,测试时无法推断反向知识“B ← A”(如Bob的妻子是Alice)。大量先前研究表明,这一失败是自回归因果LLM固有的根本局限,意味着这些模型倾向于记忆事实层面的知识,而非掌握更高层的规则。本文挑战这一观点,表明只需用一个名为Identity Bridge的简单正则化数据配方——形如“A → A”(如Alice的名字是Alice)——略微调整训练数据,这一看似根本的局限便可被缓解。在理论上,我们通过分析梯度下降的隐式偏置,证明在该配方下即使单层transformer也能打破逆转咒语。在实证上,我们表明用所提出数据配方微调的1B预训练语言模型,在逆转任务上取得50%的成功率,与仅在前向知识数据上训练时接近于零的成功率形成鲜明对比。我们的工作为逆转咒语提供了新的理论基础,并提供了一条有原则、低成本的路径,促使LLM从数据中学习更高层的规则。

通过Identity Bridge打破自回归语言模型的逆转咒语
图3:当 𝒛_{r_{+}}=−𝒛_{r_{-}} 时命题 3.5 的示意图。恒等式形式(Identity form)指经恒等正则化的数据集的形式,OCR 形式指其在命题 3.5 中给出的 OCR 形式。在恒等式形式中具体的“Husband-Wife”例子中,我们将 a 设为“Alice”,b 设为“Bob”,r_{+} 设为“husband”,r_{-} 设为“wife”,r_{\text{id}} 设为“name”。在对应的 OCR 形式中,s_{a}=a+r_{+} 为“Alice's husband”,s_{b}=b 为 Bob,r_{1}=r_{\text{id}} 为“name”,r_{2}=r_{-} 为“wife”。左侧的恒等式形式与右侧的 OCR 形式在语义上等价,并共享同一个测试数据集。