论文

多义性还是多义性?词汇同一性混淆了叠加度量

Polysemanticity or Polysemy? Lexical Identity Confounds Superposition Metrics

模型评测模型行为与机制分析

摘要

如果同一个神经元同时激活“贷方”和“河边”,标准度量将重叠归因于叠加——神经元必须压缩两个不相关的概念。这项工作探讨了有多少重叠是由于词汇混淆造成的:神经元会激发共享的单词形式(例如“bank”),而不是两个压缩的概念。 2x2 阶乘分解表明,跨 110M-70B 参数的模型,纯词汇条件(相同单词,不同含义)始终超过纯语义条件(不同单词,相同含义)。这种混淆会进入稀疏自动编码器(18-36% 的特征混合意义),位于 <=1% 的激活维度,并损害下游任务:将其过滤掉可以改善词义消歧并使知识编辑更具选择性(p = 0.002)。