论文

容量、响应性与对齐:潜在结构怎样成为可操作的控制方向

Capacity, Responsiveness and Alignment: What Makes a Latent Structure Actionable

模型评测模型行为与机制分析

摘要

定位语言模型 (LM) 激活空间中的潜在结构对于理解和控制其行为至关重要。然而,局部结构的因果影响可能存在很大差异,这就提出了一个问题:什么使结构具有可操作性。我们通过将因果影响视为三个因素的产物来解决这个问题,并凭经验证明它们充当可解释的、独特的约束:容量、测量模型输出对沿结构移动的敏感性、响应性、捕获概念在当前上下文中的推广程度以及一致性,反映结构与概念的特定上下文表示的一致性程度。在 4 个 LM 系列和 50 个概念中,我们观察到因果有效性要求所有因素都很高;低容量和低响应能力分别使其降低 84% 和 95%,而低对齐则可以逆转这一情况,抑制概念表达。此外,我们发现因果关系是上下文相关的,而不是结构的内在属性,因果有效方向形成了一个随上下文而变化的低维子空间。通过将线性 探针 的训练限制到这个子空间,我们引入了因果 探针,它在跨模型的转向方面实现了 17%-118% 的改进,而概念检测仅减少了 3%。

容量、响应性与对齐:潜在结构怎样成为可操作的控制方向:论文原图
图 1:能力预测干预效果。预测和观察到的干预诱发的 KL 在干预强度方面非常一致。