论文

语言模型与划分作斗争

Language models struggle with compartmentalization

模型评测模型行为与机制分析

摘要

在 大语言模型 (LLM) 使用的训练数据中,相同的潜在概念通常以多种不同的方式呈现:相同的事实以英语和斯瓦希里语出现;许多函数可以用Python和Haskell来表达;我们可以用正式语言和自然语言表达命题。我们证明 LLM 可以表现出区隔化,它们无法识别和共享统一概念的不同表示之间的统计强度。在最坏的情况下,LLM 只是学习概念的每个表示的并行内部表示,从而使模型容量因冗余而饱和,并随着此类表示的数量而降低样本效率。我们还证明,尽管合成并行数据本身很容易学习,但它可能无法改善这一点。在这个框架下,我们发现,对于小模型,早期的多语言学习几乎完全是划分的。最后,我们研究的所有干预措施都表现出一个相变,其中它们的有效性取决于不同表示的数量,这表明语言建模目标可能只会不一致地统一表示。