论文
激活转向控制什么?答案编码和输出敏感子空间的归因
What Does Activation Steering Control? Attribution Across Answer Encodings and Output-Sensitive Subspaces
摘要
激活引导通常在用于构建方向的答案编码下进行评估。报告的增益可以反映预期的判断或与构建期间看到的答案标识符的兼容性。我们引入了交叉编码指导评估,它会冻结干预,同时对相同保留项目的答案进行重新编码。在 NormBank 上,重新分配 A/B/C 标识符后,对比激活添加 (CAA) 会导致提取索引的目标与源得分变化比新映射下的语义标签更大。我们将此称为以下提取索引。不同的标识符词汇(A/B/C、X/Y/Z 或 1/2/3)和行顺序表明该效果跟踪提取索引而不是行位置。在跨层匹配方向规范后,提取索引跟随主要出现在较晚的深度。包含 15.4% 方向平方范数的低秩输出敏感组件保留了 96.3% 的此效应。在三个模型中,推理时间干预 (ITI) 风格的方法也有利于在 NormBank 上遵循提取索引而不是语义标签。总的来说,MNLI 倾向于提取索引遵循,而 Social Chemistry 101 (SC101) 倾向于语义标签遵循。多项选择和开放式评估可以产生不同的行为结论。因此,一种答案编码下的转向增益本身并不识别干预控制的内容。