论文
每个词元抛硬币:大语言模型 的伯努利稀疏转向
A Coin Flip Per Token: Bernoulli Sparse Steering of Large Language Models
摘要
通过稀疏自动编码器 (SAE) 的激活控制可以实现 大语言模型 的行为控制,而无需特定于任务的 微调,但标准方法将控制信号应用于每个生成的词元,从而导致每个词元不断受到扰动,从而有降低流畅性的风险。我们问:是否需要密集干预?我们引入了随机词元引导(STS),它以概率 $p$ 独立地门控每个词元,以及随机块引导(SBS),它每个序列门控一次前导窗口;两者都不需要奖励模型或学习的门控策略。在两个模型系列和两个行为任务中,仅 50% 的词元转向即可恢复大部分密集转向效果,同时保持流畅性,而仅 30% 的转向就超过了基于提示的控制。最佳转向幅度与干预比率成反比,这表明 SAE 介导的控制是有速率限制的:行为结果取决于序列中的累积信号剂量。