论文

一台token就足够了:通过前缀转向桥接提示和激活转向

One Token Can Be Enough: Bridging Prompting and Activation Steering with Prefix Steering

模型推理解码与生成控制

摘要

提示通过初始上下文引导语言模型行为,而激活引导通常在整个生成过程中进行干预。一个自然的问题是,转向是否可以对后续计算产生类似于提示的效果。在固定状态注意力假设下,我们为单token转向和多token转向建立充分条件,以匹配提示引起的注意力头输出,并描述输入表示的变化如何影响这种匹配及其近似误差。这种注意力层面的联系让我们不禁要问,在行为层面上,引导是否也可以通过简短的初始干预来指导下一代。我们研究前缀转向,它从最终提示token开始在短时间内应用现有的转向方向和操作员,之后不再进行进一步的直接干预。我们研究干预持续时间和强度如何共同影响控制能力的权衡。在四个模型和五个任务中,短时间的干预,甚至是单个token,通常会保留大部分完全转向的行为控制,同时更好地保留一般功能,提供与提示和替代转向强度策略竞争的权衡,并且在某些设置中优于提示和替代转向强度策略。前缀引导对于推理后的最终答案格式化任务仍然有效,这表明简短的初始干预可以影响引导结束后良好表达的行为。这些发现挑战了引导每个生成的token的常见做法,并激发了激活引导的更动态的观点,其中短暂的干预可以改变后续生成的轨迹,而无需持续干预。