论文

解码前的拒绝:检测并利用LLM中间激活中的拒绝信号

Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations

模型评测模型行为与机制分析

摘要

在本文中,我们研究了在使用在每个变压器块的残余流激活上训练的线性探针进行解码之前是否可以从LLM中间激活来预测拒绝行为。我们发现拒绝在最后一层之前就可以线性解码,这表明与安全相关的行为在输出生成之前的中间激活中得到体现。为了测试该信号是否可行,我们引入了 Mechanistic AutoDAN,这是 AutoDAN 的一种探针引导变体,它用部分前向传递和遗传提示搜索循环内基于探针的评分取代了全模型适应性评估。在评估的模型中,我们的方法实现了与普通 AutoDAN 竞争的攻击成功率,同时将每次迭代搜索时间减少了高达 72%,并且探针引导的提示在多种配置中匹配或超过了 AutoDAN 的跨模型传输。我们进一步发现探针引导的有用性随着模型规模的增加而增加。我们的结果表明,拒绝不仅可以在输出层面观察到,而且可以在中间 LLM 激活中被编码为结构化且可操作的信号。

解码前的拒绝:检测并利用LLM中间激活中的拒绝信号
图 1:机械 AutoDAN 概述。