论文

拉丁语基底:语言模型如何表示和调节脚本选择

The Latin Substrate: How Language Models Represent and Mediate Script Choice

模型评测模型行为与机制分析

摘要

许多语言都是用多种文字编写的,需要 大语言模型 (LLM) 以不同的拼写形式生成等效的语言内容。虽然之前的工作表明 LLM 通过共享潜在表示传递信息,但它们如何在内部调解脚本变化仍然知之甚少。我们首先使用 logits 镜头检查每层输出分布来研究这个问题,这揭示了音译过程中一致的潜在罗马化,然后通过脚本生成的表征和机制分析。在表征层面,我们表明同一语言的脚本在各层之间变得越来越可分离,并且简单的线性转向方向可以翻转模型的输出脚本,同时在很大程度上保留语义内容。该向量泛化到构建过程中看不见的书写系统:它将非拉丁输出翻转为拉丁文,但将拉丁输出映射到各种非拉丁脚本。在机制层面,我们定位了一小部分后期层注意力头,它们因果地调节脚本选择。这些头在不相关的语言和书写系统之间传输,表明脚本路由是由与语言无关的组件实现的。在这两项分析中,我们观察到一致的方向不对称性:非拉丁输出是由紧凑的、可识别的门产生的,而拉丁文字输出则来自整个模型的分散贡献。总体而言,我们的研究结果表明,LLM 围绕共享的潜在表示组织脚本变体,同时展示了拉丁脚本的特权基础。