论文
通过Identity Bridge打破自回归语言模型的逆转咒语
Breaking the Reversal Curse in Autoregressive Language Models via Identity Bridge
摘要
自回归大语言模型(LLM)在许多复杂任务上取得了显著成功,但仍可能在非常简单的逻辑推理上失败,例如“逆转咒语”(reversal curse)——当模型在形如“A → B”的前向知识数据(如Alice的丈夫是Bob)上训练后,测试时无法推断反向知识“B ← A”(如Bob的妻子是Alice)。大量先前研究表明,这一失败是自回归因果LLM固有的根本局限,意味着这些模型倾向于记忆事实层面的知识,而非掌握更高层的规则。本文挑战这一观点,表明只需用一个名为Identity Bridge的简单正则化数据配方——形如“A → A”(如Alice的名字是Alice)——略微调整训练数据,这一看似根本的局限便可被缓解。在理论上,我们通过分析梯度下降的隐式偏置,证明在该配方下即使单层transformer也能打破逆转咒语。在实证上,我们表明用所提出数据配方微调的1B预训练语言模型,在逆转任务上取得50%的成功率,与仅在前向知识数据上训练时接近于零的成功率形成鲜明对比。我们的工作为逆转咒语提供了新的理论基础,并提供了一条有原则、低成本的路径,促使LLM从数据中学习更高层的规则。
