论文

通过融合邻近特征选择增强基于SAE的模型引导

Enhancing SAE-based Steering via Neighbor Integrated Feature Selection

模型推理解码与生成控制

摘要

稀疏自动编码器 (SAE) 将模型激活分解为可解释的特征,并广泛用于引导大语言模型。大多数现有的基于 SAE 的转向方法通过应用基于统计分数的顶部过滤器来选择特征,假设得分较高的特征会产生更强的转向效果。在本文中,我们表明这种假设通常是无效的,导致特征选择不理想。我们的分析表明,有效的转向特征可能分布在由 SAE 中的特征分裂引起的代表性相邻、语义相似的组中。在这些组中,尽管具有相当的转向影响,但特征可能会表现出不同的统计分数,导致基于分数的选择忽略重要的特征。基于这些观察,我们提出了\textsc{邻居集成特征选择}(\textsc{NIFS}),这是一种即插即用的策略,利用表示相似性来改进转向的特征选择。我们在多种基于 SAE 的转向方法和任务中评估 \textsc{NIFS},并展示了相对于传统的 top-$k$ 选择的一致的性能增益。

通过融合邻近特征选择增强基于SAE的模型引导:论文配图
(a) SPARE(b) SAIF(c)STA(d) Diffume Figure 4:指导成功率(SR)和Gemma2-2B上不同尺寸(顶kk)的解毒任务相邻特征的平均相近性。这四个分图对应了四种方法:SPARE、SAIF、STA和Diffmoin。