论文

语言模型形式语言能力的异质性:数据是真正的瓶颈吗?

Heterogeneity in Formal Linguistic Competence of Language Models: Is Data the Real Bottleneck?

模型训练预训练

摘要

大语言模型 (LLM) 在形式语言能力方面表现出令人费解的差异:虽然他们近乎完美地掌握了一些语言现象,但即使在数万亿个标记的训练之后,他们在其他语言现象上的表现也常常低于预期。在这项工作中,我们调查这些失败是否源于固有的架构限制,或者仅仅是网络规模语料库中这些特定语法结构的稀缺。我们在 FineWeb 语料库的 100M 词元随机样本上预训练简单的 GPT-2 Small (124M) 模型,并通过注入针对特定语言现象的最少量 (1%) 的合成数据进行干预。我们发现,这种有针对性的干预极大地提高了 9 个表现最差的 BLiMP 范例中的 8 个的模型性能 - 特别是特定范例 only_npi_scope 的准确性从 20.9% 飙升至 69.4%。此外,我们观察到这些干预措施通常会保持或略微提高总体绩效。然而,虽然我们也发现了一种抵抗现象,principle_A_c_command,即使在我们的数据增强之后,其性能仍然低于机会,但我们的发现确实作为一个乐观的存在证明,即使是小型语言模型也可以显着改善那些模型通常表现不佳的语言现象,只要 预训练 数据包含足够的暴露量。这表明,通过关注数据组合,人类规模语言建模的努力可能会大大受益。重现我们结果的代码是开源的,位于 https://github.com/kowndinya-renduchintala/heterogeneity-in-formal-linguistic-competence。