论文

像 LLM 一样转向:模仿提示的激活转向

Steer Like the LLM: Activation Steering that Mimics Prompting

模型推理解码与生成控制

摘要

大语言模型 可以通过提示或激活干预在推理时进行引导,但与基于提示的方法相比,激活引导方法通常表现不佳。我们提出了一个框架,将即时转向制定为激活转向的一种形式,并研究将成功的即时转向行为提炼成更简单、可解释的模型是否可以缩小这一差距。我们的分析表明,流行的激活引导方法并不忠实于提示引导的机制,即对某些词元进行强烈干预,而几乎不影响其他词元。基于这些见解,我们引入了提示转向替换(PSR)模型,该模型根据激活本身估计特定于词元的转向系数,并经过训练来模仿基于提示的干预。跨多种语言模型的三个转向基准的实验表明,PSR 模型优于现有的激活转向方法,特别是在控制高连贯性完成时,并且也优于 AxBench 和角色转向上的提示。