论文
自动解释标签的概括程度:跨语言、脚本和改写的对照研究
How Far Do Auto-Interpretation Labels Generalize: A Controlled Study Across Languages, Scripts, and Rewordings
摘要
稀疏自动编码器 (SAE) 功能越来越多地用于解释语言模型,自动生成的自然语言标签作为理解每个功能所代表的内容的主要界面。我们询问这些标签是否具有普遍性:为某个概念标记的功能是否实际上跨语言和脚本跟踪该概念?使用塞尔维亚双写法作为受控测试平台(通过确定性音译以拉丁语和西里尔语书写的同一种语言),我们首先发现由不同语言、脚本和措辞中的相同内容激活的 SAE 特征集具有大量重叠(平均 Jaccard 0.39 与 0.13 随机基线,峰值为 0.57),表明真正的跨语言语义特征。然后我们测试自动解释标签是否跟上步伐。但它们通常不会:标签描述语义内容的特征在塞尔维亚语中错过相同含义的频率比英语高 4 倍,并且错过塞尔维亚西里尔字母的次数比塞尔维亚拉丁语多(这两种文字是彼此确定性的音译),这表明失败与每种形式在训练中的表现程度一致。随着网络深度的增加,差距越来越大,但标签并没有表明它们失败了。这些结果表明,自动解释标签可能反映特征在良好表示的输入上的行为,而不是概念本身。