论文
以SAE引导解决知识冲突的关键路径识别
Key Path Identification for Resolving Knowledge Conflicts via SAE-based Steering
摘要
基于稀疏自动编码器(SAE)的引导已被广泛用于通过指导大语言模型更加忠实于上下文知识来解决知识冲突。现有方法通常执行质量控制,这会修改通过基于相关性的方法识别的大量 SAE 特征。然而,由于相关性不准确和忽略了特征相互作用,质量转向方法无法精确识别在转向中起关键作用的特征,并引入大量冗余特征,从而增加了噪声并削弱了转向效果。我们的实证研究表明,仅控制已识别特征的一小部分就可以实现可比甚至更好的性能。受这一发现的启发,我们提出了关键路径识别(KPI),这是一种识别关键转向特征的新方法,其特征是与上游和下游特征的强因果依赖性。 KPI 根据这些功能构建关键路径并通过较少的功能修改进行引导。通过这种方式,KPI 将基于 SAE 的转向从数量驱动转向以质量为中心,为更精确和可解释的模型编辑提供了视角。在具有知识冲突的RAG任务中进行的实验表明,与质量转向的最佳基线相比,我们的方法平均提高了18%的精度,有效过滤了冗余特征,减轻了副作用,并展示了关键路径在转向中的核心作用。