论文
超越转向向量:用于推理时间干预的基于流的激活转向
Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention
摘要
激活引导已成为通过修改中间表示同时保持模型参数冻结来控制推理时语言模型行为的有前途的替代方案。然而,诸如 AxBench 之类的大规模评估表明,现有的引导方法通常无法通过简单的上下文提示来实现,并且对于未见过的概念的泛化能力较差。我们假设这些限制源于先前方法中共享的未经验证的简化假设,这些假设通常将引导干预限制为固定的、单步的、位置不变的变换。我们提出 FLAS(基于流的激活转向),它学习一个通用的、概念条件的速度场 $v_t(h,t,c)$,将非转向激活传输到转向激活,而不依赖于这些假设。在 AxBench 上,FLAS 是第一个始终优于提示的学习方法,在 Gemma-2-2B-IT 上达到 1.015的保留谐波平均值,在 Gemma-2-9B-IT 上达到 1.113,无需按概念进行调整。对学习流的分析显示了弯曲的、多步骤的、词元变化的轨迹,这表明先前关于激活空间几何的假设可能是不完整的。