论文

原子特征的可检验理论

A Testable Theory of Atomic Features

模型评测模型行为与机制分析

摘要

我们开发并测试了存在原子特征的语言模型表示理论。我们的主要理论见解是,在这样的模型中,大小不断增加的稀疏字典(例如 SAE)会恢复训练数据中最常见原子的不断增加的前缀。这种“恢复原理”产生了三个可测试的预测:小型 SAE 中的许多特征由所有较大的 SAE 共享,SAE 在两者中普遍存在的不同数据共享特征上进行训练,并且足够大的 SAE 恢复父特征和子特征。与 SAE 特征随着大小增加而不稳定和“分裂”的传统观点相反,我们发现这些预测适用于在两个大型嵌入模型上训练的大小范围从 512 到 131,072 的 SAE。从理论角度来看,我们的结果表明基于原子特征的科学表征理论的前景。实际上,我们的结果表明了扩展 SAE 的希望。

原子特征的可检验理论的原论文方法或结果图
图 2:测试 P1、P2 和 P3——原子理论的预测。