论文

对连续变量的因果干预:情境学习引导向量中动词偏差的案例研究

Causal Interventions on Continuous Variables: A Case Study on Verb Bias in Steering Vectors for In-Context Learning

模型评测模型行为与机制分析

摘要

语言模型表示中的因果干预主要针对离散特征,例如语法数字。然而,语言模型还必须利用分级特征。我们引入了一种对连续变量进行因果干预的方法:给定与分级目标变量配对的激活向量,我们定位该变量的低维方向,并使用该方向将向量编辑为反事实目标值。我们将此方法应用于心理语言学中经过充分研究的连续特征,即动词偏差(反映了哪些句法结构倾向于遵循给定的动词)。我们表明,动词偏见在从 大语言模型 中提取的转向向量中因果地表示:对动词偏见的反事实编辑系统地改变了下游结构偏好。动词偏见之前也被认为与情境学习有关。在进一步的分析中,我们发现引导向量编码错误信号,这些信号可以驱动上下文学习中看到的错误驱动的更新行为,但引导向量的这些方面并没有在下游生产中因果性地使用。总的来说,这些结果表明因果干预可以应用于连续变量,尽管将连续变量与情境学习联系起来仍然是一个挑战。