论文

读取激活中的任务失败:间接对象识别上 GPT-2 Small 的稀疏特征审计

Reading Task Failure Off the Activations: A Sparse-Feature Audit of GPT-2 Small on Indirect Object Identification

模型评测模型行为与机制分析

摘要

我们报告了一项小型的、可重复的审计,其中 GPT-2 小火的稀疏自动编码器 (SAE) 特征在间接对象识别 (IOI) 任务的失败和成功试验中有所不同。在 300 个提示上,GPT-2 Small 达到 79.7% 的准确率; Bloom (2024) 的第 8 层残差流 SAE 版本中的 24,576 个特征中有 146 个特征清除了 Holm 校正的显着性阈值,并且 105 个特征达到了较大的效应大小(|Cohen's d| > 0.8)。最强的单一故障相关性——特征 17,491,d=+2.93,Neuronpedia 标签“加密密钥”——基本上是无声的,除非提示的传输对象是“密钥”,在该对象上,GPT-2 小的失败率为 93.3%,而其他七个对象为 7.5%(Fisher 精确 p = 8.79 x 10^-33)。我们通过机械主张应通过的三个控制来建立这种关联。 (i) 因果消融:将 45 个键提示的所有标记位置的剩余流中的特征 17,491 归零并不能恢复准确性(6.7% -> 4.4%);该特征是这一层的相关因素,而不是充分原因。 (ii) 表示基线:对原始 768 维残差流进行逻辑回归达到 5 倍 ROC AUC = 0.929,匹配前 100 个 SAE 特征 (0.927); SAE 基础增加了可解释性,而不是预测能力。 (iii) 种子鲁棒性检查:在五个随机种子中,密钥子集失败率保持在 75.0--93.3%(行为效应是真实的),但特征 17,491 是 top-|d|仅在 5 次运行中的 1 次出现。因此,方法论的贡献是审计管道(廉价、与模型无关、名为关联的表面),而不是通过它找到的任何单个特征。我们发布了代码、300 个提示语料库、300x24,576 激活矩阵、消融和基线脚本以及图形。完整的管道在笔记本电脑上运行(Apple M3 Max,无独立 GPU)。