论文
语言模型中的分布式稀疏干预
Distributed Sparse Interventions in Language Models
摘要
语言模型以不同的抽象级别执行各种任务,能够灵活地从上下文推断任务、同时执行多个任务以及在竞争任务中进行选择。为了研究模型组件在任务行为中的作用,可以通过干预来调查它们的因果影响。先前关于模型控制的工作主要集中在激活空间中全局方向的干预,将任务表示建模为近似线性和可加性。通过研究神经元水平的干预,我们发现对模型输出的大量神经元特异性非线性影响是当前引导方法无法捕获的。我们引入分布式稀疏干预(DSI),这是一种干预方法,它考虑跨层神经元之间的非线性和相互作用,以识别引发任务相关计算的稀疏神经元集。在一系列任务中,我们证明 DSI 可以通过对少至 0.01% 的神经元进行本地化和干预来激活指令调整语言模型中的任务行为,突出了神经元基础上稀疏、分布式干预的有效性。此外,采用基于集合的视角可以对已识别的神经元集进行计算,通过分析单个神经元在任务中的影响来深入了解单个神经元的作用。通过稀疏干预,DSI 能够对模型行为进行细粒度控制,定位与任务相关的神经元集,并进一步加深我们对任务构成的理解。