论文

当语言表示交互时:LLM 中的可分离性和跨语言效应

When Language Representations Interact: Separability and Cross-Lingual Effects in LLMs

模型评测模型行为与机制分析

摘要

大语言模型表现出强大的多语言能力,但其内部表示难以解释。了解这些交互对于确保多语言系统中的可靠行为非常重要。最近的工作表明,因果几何结构可以解释某些概念如何被编码为近似线性和可分离的方向,但该框架是否扩展到语言身份相关且分层的多语言模型尚待探索。我们将因果几何分析应用于多语言 LLM,研究了三个模型中的 28 个双语对比,使我们能够分析语言何时表现得近似独立因素以及结构化依赖性何时持续。我们发现证据表明,语言概念承认稳定的线性表示,这些表示在协方差调整(因果)内积下很大程度上是可分离的,并且结构偏差反映了语言相似性。此外,同一语系中的语言(例如日耳曼语或罗曼语)表现出类似单纯形的几何结构,表明等级组织。这些结果将因果几何可解释性扩展到多语言环境,并深入了解多语言 LLM 表示中如何存在可分离性和相似性,从而激发可解释性分析,以诊断何时以及如何预测概念之间的结构化依赖关系。这对可信部署有影响,因为当模型受到监视或干预时,语言之间的残余结构可能会导致意想不到的跨语言效应。