论文
通过融合邻近特征选择增强基于SAE的模型引导
Enhancing SAE-based Steering via Neighbor Integrated Feature Selection
摘要
稀疏自动编码器 (SAE) 将模型激活分解为可解释的特征,并广泛用于引导大语言模型。大多数现有的基于 SAE 的转向方法通过应用基于统计分数的顶部过滤器来选择特征,假设得分较高的特征会产生更强的转向效果。在本文中,我们表明这种假设通常是无效的,导致特征选择不理想。我们的分析表明,有效的转向特征可能分布在由 SAE 中的特征分裂引起的代表性相邻、语义相似的组中。在这些组中,尽管具有相当的转向影响,但特征可能会表现出不同的统计分数,导致基于分数的选择忽略重要的特征。基于这些观察,我们提出了\textsc{邻居集成特征选择}(\textsc{NIFS}),这是一种即插即用的策略,利用表示相似性来改进转向的特征选择。我们在多种基于 SAE 的转向方法和任务中评估 \textsc{NIFS},并展示了相对于传统的 top-$k$ 选择的一致的性能增益。
