论文
Rank-1 转向何时便宜?几何、粒度和预算搜索
When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search
摘要
激活转向提供了一种无需重新训练即可控制 LLM 的轻量级方法,但其有效性因概念而异。先前的工作经常将这种变化视为许多概念并不是由单一转向方向捕获的证据。相反,我们认为其中大部分反映了搜索难度:有用的 1 级干预措施通常存在,但找到它可能会很昂贵。我们将 1 级引导形式化为对干预层和系数的预算约束优化。在概念和模型系列中,即时边界方向对齐可以预测有效干预发生的位置,从而实现几何引导搜索,以更少的评估次数实现高效用,从而在三个模型系列中平均将恢复 95% 最佳发现效用所需的试验减少 39.8%。为了解释为什么有些概念即使在更好的搜索下仍然昂贵,我们引入了概念粒度,一种跨对比上下文的方向异质性的度量。粒度将差异向量共享稳定全局方向的概念与提示在每个输入内局部一致但效用最大化方向在输入之间系统地旋转的概念区分开来。较高的粒度与较慢的收敛速度和较低的最佳发现性能相关(Pearson $r{=}0.44$,试验达到 95%,$r{=}{-}0.46$,最佳发现效用,两者均为 $p<0.001$)。我们提出了 GRACE,一种粒度和表示感知的概念工程框架,它使用激活几何来诊断转向困难的主要来源,选择适当的补救措施,并有效地分配优化工作。我们的结果将框架从“rank-1 何时失败?”到“Rank-1 何时廉价且稳定?”,将激活几何从描述性工具转变为 LLM 控制的可操作先验。