论文

CRaFT:基于跨层转码器的电路引导拒绝特征选择

CRaFT: Circuit-Guided Refusal Feature Selection via Cross-Layer Transcoders

模型评测模型行为与机制分析

摘要

随着大语言模型 (LLM) 的安全问题日益严重,了解拒绝行为背后的内部机制变得越来越重要。最近的工作通过识别与拒绝相关的内部特征并操纵它们来诱导遵守有害请求来研究这种行为。然而,现有的拒绝特征选择方法依赖于特征在有害提示下激活的强度,这往往会捕获表面信号,而不是拒绝决策背后的因果因素。我们提出了 CRaFT,一种电路引导的拒绝特征选择框架,它使用拒绝边界附近的提示,根据特征对模型拒绝合规决策的影响对特征进行排名。在 Gemma-3-1B-it 上,CRaFT 将攻击成功率 (ASR) 从 6.7% 提高到 48.2%,并且在多个越狱基准测试中优于基准方法。这些结果表明,对于识别因果介导拒绝行为的特征,电路影响是比激活幅度更可靠的标准。

CRaFT:基于跨层转码器的电路引导拒绝特征选择
图 1:电路引导特征选择 (CRaFT) 和激活引导基线之间的比较。我们通过追踪控制模型在拒绝和服从之间做出决策的电路来识别因果特征。