论文

模型是否使用这个特征:区分行为操控与机制作用

Does the Model Use the Feature? Separating Steering from Mechanism in LLMs

模型评测模型行为与机制分析

摘要

当 LLM 中的内部特征跟踪一个概念并且其操作改变相关行为时,它们通常被解释为机制。然而,转向可以将特征推到其自然范围之外,其效果不需要反映模型自身的计算。我们检查了这一推论,并提出了一个经验契约,其测试评估自然输入观察到的值的特征。一个测试将功能的值从显示行为的输入复制到不显示行为的匹配输入(安装)或相反(删除);另一个在上游编辑(下游救援)后恢复该功能。安装衡量功能对行为的满足程度;移除和下游救援衡量模型使用它的程度。应用于三种表示形式时,这两种优势截然不同。已发布的潜在未知实体强烈引导知识放弃,但将已发布的潜在实体的观察值安装到匹配的提示中仅传输自然已知-未知放弃对比的一小部分。密集的已知-未知方向显示了 Gemma 和 Llama 中安装和移除之间相反的不对称性,并且发布的主谓一致特征集如何完全再现和恢复行为取决于其值如何写入模型。因此,跟踪概念和引导行为本身并不表明模型使用了某个特征,并且每个结论仅适用于测试的干预。