论文
IDEEA:无需训练 通过激活集群匹配进行输入相关转向
IDEEA: training-free Input-Dependent stEEring via Activation cluster matching
摘要
转向通过在推理时向选定的激活注入偏差来对齐 大语言模型 (LLM),为权重更新方法(例如监督 微调 或强化学习)提供更便宜的替代方案。然而,大多数现有的 无需训练 转向方法都是独立于输入的:单个方向安装一次并在所有输入之间共享。这从根本上是限制性的,因为不同的输入占据激活空间的不同区域,并允许朝向同一目标概念的不同最佳转向方向,就像相对于固定损失的梯度因输入而异一样。我们通过 IDEEA(通过激活集群匹配进行输入相关转向)缩小了这一差距,IDEEA 是一个用于输入相关转向的 无需训练 框架。 IDEEA 对每个注意力头的正激活和负激活支持进行聚类,并解决最佳匹配问题以构造一组聚类条件方向,所有这些都与目标概念有关。在推理时,它从这个方向池中进行选择,并使用最匹配输入自身激活的方向进行转向。 IDEEA 将模型与目标概念对齐,同时保留输入的原始表示,这证明编码概念的激活占据表示空间的几个不同的子区域,而不是单个子区域。与最佳的独立于输入的基线相比,IDEEA 将 TruthfulQA 中的真实 $\times$ 信息率平均提高了 9.9%(高达 23.5%)。