论文
从拒答Token到拒答控制:发现并引导类别特定的拒答方向
From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions
摘要
语言模型通常通过安全对齐微调来拒答有害提示。其中一种做法是微调模型,使其在回应前生成区分不同拒答类别的类别化拒答Token。在本工作中,我们利用一个用此类类别化拒答Token微调的Llama 3 8B版本,实现对细粒度拒答行为的推理时控制,同时提升安全性与可靠性。我们证明,拒答Token微调会在残差流中诱导出可分离的、与类别对齐的方向;我们提取这些方向构建类别化引导向量,并用一个轻量探针决定推理时是引导模型趋向还是远离拒答。此外,我们引入一种学习到的低秩组合,在白化正交的引导基中混合这些类别方向,形成激活空间各向异性下单一可控的干预,并证明该干预无需额外训练即可在同架构模型变体之间迁移。在各基准上,类别化引导向量与低秩组合均能持续减少对良性提示的过度拒答,同时提高对有害提示的拒答率,凸显了它们在多类别拒答控制上的实用价值。
