论文
LLM 中特定功能纠错的证据
Evidence for feature-specific error correction in LLMs
摘要
了解 大语言模型 (LLM) 的功能是可解释性的核心目标。 LLM 通常假设使用叠加来表示比其维度更多的特征。它们不仅可以表示叠加的特征,还可以进行叠加的计算。理论预测,叠加计算需要纠错,使特征方向优先于通用方向,但这一预测尚未经过实证检验。我们提出了基于激活扰动的 LLM 误差校正的实证测试。扰动残差流激活,我们发现它们对小扰动具有鲁棒性——形成与纠错一致的激活平台——但沿候选特征方向(“纯”方向,由对比提示对构建)的鲁棒性不如沿两个这样的方向的混合,这表明纯方向是优先的。我们通过将扰动效应建模为其分解为特征分量的 $L^p$-范数的函数来量化这种特权。对于 $p=2$,响应是二次形式,最多具有与残差流维度一样多的非零特征值,这不能优先考虑叠加所需的许多特征方向。 $p>2$ 解除了此限制,并且与特定于功能的纠错一致。我们发现对比、MELBO 和 SAE 解码器方向 $p>2$,随机和 PCA 方向(对照)$p\approx2$。这些结果在 Gemma-2-9B、Qwen3-1.7B、Llama-3.1-8B、Mistral-7B-v0.3、Aya-Expanse-8B 和 Yi-1.5-9B 中重复。我们进一步在具有已知 真值 特征的纠错玩具模型上验证我们的方法,恢复 $p>2$ 的真实特征方向,当我们旋转远离它们时,退化到 $2$。