论文
左分支 Transformer 擅长右分支语言:数据形状 语言模型中的词序首选项
Left-Branching Transformers Excel at Right-Branching Languages: Data Shapes Word Order Preferences in Language Models
摘要
我们系统地比较了 192 种人工语言和类型多样的自然语言中仅解码器语言模型的词序偏好。在人工语言上,模型表现出左分支偏好,既不符合自然语言的普遍性,也不符合人类词序学习的偏见。在自然语言中,单语模型在小规模上没有表现出明显的基本词序偏差,但随着数据的增长,出现了对右分支主谓宾 (SVO) 语言的偏好,而 SOV 则落后了,尽管它是最常见的跨语言顺序。这种 SVO 优势扩展到多语言模型,并与语言资源水平和数据质量相关,而不是与词序相关。因此,相同的架构对人工语言和自然语言表现出相反的偏好,从而证明在实践中观察到的词序偏差是数据驱动的。由于资源丰富的语言绝大多数都是 SVO,因此这些偏差可能会逐渐减少词序多样性,特别是在有效使用多个词序的语言中,随着 LLM 的广泛采用。