论文

普遍的氛围?使用 SAE 查找和控制与语言无关的非正式注册

A Universal Vibe? Finding and Controlling Language-Agnostic Informal Register with SAEs

模型评测模型行为与机制分析

摘要

虽然多语言模型成功地跨语言传递事实和句法知识,但仍不清楚它们是否将特定于文化的语用语域(例如俚语)处理为孤立的特定于语言的记忆或统一的抽象概念。我们通过使用稀疏自动编码器 (SAE) 跨三种类型不同的源语言(英语、希伯来语和俄语)探索 Gemma-2-9B-IT 的内部表示来研究这一问题。为了明确地将语用语域处理与琐碎的词汇敏感性分开,我们引入了一个新颖的数据集,其中每个目标术语都是多义的,出现在字面和非正式上下文中。我们发现,虽然大部分非正式语域信号分布在特定于语言的特征中,但一个小但高度鲁棒的跨语言核心不断出现。这个共享核心形成了一个几何上连贯的“非正式语域子空间”,该子空间在模型的更深层中变得清晰。至关重要的是,这些共享表示不仅仅是相关性的:使用这些功能的激活控制会因果性地改变所有源语言的输出形式,并将零样本转移到跨越不同语系和脚本的六种看不见的语言。总之,这些结果提供了第一个机械证据,证明多语言 LLM 不仅将非正式语域内化为表面启发式,而且将其内化为可移植的、与语言无关的实用抽象。