论文

必要、可解码且可逆但不可迁移:机制可解释性组件角色分配的压力测试

Necessary, Decodable and Reversible, Yet Not Transferable: A Stress Test for Attention-Head Role Claims

模型评测模型行为与机制分析

摘要

机制研究通常会在移除某个组件会损害行为时为其分配一个角色,它的激活会线性编码任务信息,而恢复该激活会修复损坏。我们测试更强的含义:相同的激活是否可以将请求的计算携带到另一个提示中?在接受我们完全匹配控制转移测定的 15 个模型系列细胞中的大约 8 个(涵盖三个 7-8B 指令调整模型和 5 个单步计算系列)中,测试的注意力头状态没有产生干净的计算转移。相反,相同答案和匹配上下文控制会暴露出惰性或广泛的效果。积极的控制限制了这一结果,而不是消除其警告:仪器在写入未指定的提示时恢复已知的函数向量,并在三个受控模型种子之一中恢复紧凑的可覆盖剩余状态。这两种控制都没有证明在提示覆盖期间对真实模型注意力所携带的对象的敏感性。在 Qwen 的两个组合形式上,强可解码的操作方向也未能引导生成的答案通过门;相应的跨模型测试无效。这些结果表明,必要性、可解码性、相同提示修复和交叉提示转移是可分离的证据。他们并没有确定未经测试的组件或设置不存在可移植选择状态。