论文

MetaSteer:通过注意力投射适应进行上下文条件非线性转向

MetaSteer: Context-Conditioned, nonlinear Steering via Attention-Projection Adaptation

模型训练偏好优化

摘要

引导大语言模型通常依赖于激活空间中的线性、上下文无关的干预,这是最近的工作所挑战的假设,并且当固定表示必须编码许多行为区别时,可能会导致信息瓶颈。我们引入了 MetaSteer,一种学习具有上下文相关效应的非线性干预并将其应用于注意投影矩阵的方法,通过构造产生随输入上下文变化的激活效果,并且不需要线性概念几何假设。 MetaSteer 采用基于偏好的优化,在汇集的偏好语料库上进行一次训练,并将零样本转移到未见过的概念和分布外上下文。我们发现,尽管使用低秩适配器,MetaSteer 仍会在隐藏状态轨迹中引发结构化的、依赖于上下文的变化,同时部分保留其局部轨迹动力学的各个方面,包括速度和曲率。我们在多个模型系列和规模的三个受控文本生成基准和三个 Agentic 设置上评估 MetaSteer。在零样本情况下的大多数总体比较中,MetaSteer 匹配或优于强大的特定于任务的转向基线。在评估的设置中,更强的文本生成转向与更强的 Agentic 转向性能相关。我们进一步讨论可转移转向带来的几何轨迹效应、能力保持和安全考虑。