论文

从拒答Token到拒答控制:发现并引导类别特定的拒答方向

From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions

模型推理解码与生成控制

摘要

语言模型通常通过安全对齐微调来拒答有害提示。其中一种做法是微调模型,使其在回应前生成区分不同拒答类别的类别化拒答Token。在本工作中,我们利用一个用此类类别化拒答Token微调的Llama 3 8B版本,实现对细粒度拒答行为的推理时控制,同时提升安全性与可靠性。我们证明,拒答Token微调会在残差流中诱导出可分离的、与类别对齐的方向;我们提取这些方向构建类别化引导向量,并用一个轻量探针决定推理时是引导模型趋向还是远离拒答。此外,我们引入一种学习到的低秩组合,在白化正交的引导基中混合这些类别方向,形成激活空间各向异性下单一可控的干预,并证明该干预无需额外训练即可在同架构模型变体之间迁移。在各基准上,类别化引导向量与低秩组合均能持续减少对良性提示的过度拒答,同时提高对有害提示的拒答率,凸显了它们在多类别拒答控制上的实用价值。

从拒答Token到拒答控制:发现并引导类别特定的拒答方向:论文配图
图 2:我们的激活提取、分类引导向量计算、线性探测和推理时间引导框架,这会导致拒绝不安全提示并减轻对良性提示的过度拒绝。