论文

EmoRSS:减轻大语言模型中情绪引起的过度拒绝

EmoRSS: Mitigating Emotion-Induced Over-Refusal in Large Language Models

模型推理解码与生成控制

摘要

情绪表达可以影响大语言模型 (LLM) 的安全决策,为改善安全一致性提供了潜在途径。现有的研究主要集中在情绪表达如何促进有害请求下的攻击,而忽视了它们对良性请求的影响。我们发现,情绪表达也会系统性地增加善意请求的拒绝倾向,导致不必要的过度拒绝。基于这一观察,我们提出了情绪引导的拒绝子空间转向(EmoRSS),这是一种激活转向方法,可以减轻情绪引起的过度拒绝,同时保留对有害请求的拒绝行为。具体来说,我们首先使用逐层线性探针识别拒绝敏感层,并从与探针方向对齐的稀疏自动编码器 (SAE) 特征构造拒绝子空间。接下来,我们使用配对的常规请求和情感请求以及相同的查询来估计定义拒绝子空间的特征中的平均激活偏移。最后,我们将这种转变解码为激活干预向量,并在推理过程中将其应用于反向拒绝方向,而不更新骨干模型参数。对两个LLM的实验表明,当请求包含情绪表达时,我们的方法比之前的过度拒绝缓解基线在拒绝有害请求和回答良性请求之间实现了更有利的权衡,同时更好地保留了一般任务性能。

EmoRSS:减轻大语言模型中情绪引起的过度拒绝的原论文方法或结果图
图 2:EmoRSS 概述。我们首先识别拒绝敏感层,并通过选择解码器方向与拒绝方向对齐的 SAE 特征来构造拒绝子空间 $\mathcal{S}_{\mathrm{ref}}$。然后,我们使用匹配的常规查询和情感查询来估计该子空间内情绪引起的激活变化。最后,EmoRSS 以可控的干预强度扭转了拒绝敏感层的估计变化,减轻了情绪引起的过度拒绝,同时保证了有害请求的安全。