论文
作为 SAE 潜在空间中的突现类别的词性
Parts-of-Speech as Emergent Categories in SAE Latent Space
摘要
稀疏自动编码器(SAE)提供了一种有前途的方法来检查语言模型表示,但仍不清楚它们的潜伏暴露了什么样的语言结构。我们使用词性(PoS)类别作为受控测试用例来研究形态句法信息是由个体潜在特征还是由结构化特征组编码。我们发现 PoS 的区别可以从 SAE 激活中高度恢复,但与一对一的潜在/类别映射不一致。这种可恢复性不能简化为词汇记忆,并且开放式和封闭式 PoS 类别存在很大差异。类别由稀疏潜在变量的紧凑组支持,标签之间存在很大差异。这些群体在保留的数据上保持稳定,同时也显示出相关类别之间的重叠。我们的结果表明,SAE 以分布式和类别相关的形式而不是通过原子语法特征来定位形态句法信息。