论文

安全护栏需要推理吗?LeanGuard:快速轻量的稳健审核方法

Do Safety Guardrails Need to Reason? LeanGuard: A Fast and Light Approach for Robust Moderation

模型优化小模型/轻量模型

摘要

为筛查提示或响应——近期护栏方法在给出裁定前生成思维链(CoT)。该设计遵循“逐步推理改进决策”的常见信念。但CoT也使护栏沉重缓慢——模型必须在决定前生成许多token。这可能与护栏的实际部署方式不匹配。护栏有时不应沉重缓慢——且常在设备上运行——例如具身机器人上。本文提出一个问题:安全护栏真的需要推理吗。为回答——我们在同一语料上训练轻量双向编码器与推理护栏——然后仅移除推理、保持其余不变。经这一受控同基座比较——我们表明思维链不改进审核准确率。我们把所得护栏命名为LeanGuard。395M仅标签编码器在公开基准上达平均F1 82.90±0.26——匹敌建立在更大解码器上的推理护栏——同时仅对至多512 token的输入做单次前向。这约为100倍的推理算力削减。我们进一步表明该仅标签编码器在训练标签噪声下保持稳健——并在严格假阳性率下保留远高于推理护栏的召回——因此更重的推理护栏也非更稳健之选。我们的发现提示:当前护栏基准可能不够难以奖励推理——CoT对审核的必要性仍未被证明。我们在 https://github.com/ndb796/LeanGuard 发布包括LeanGuard在内的全部源代码与模型。

安全护栏需要推理吗?LeanGuard:快速轻量的稳健审核方法:论文配图
图 2:保护解码器的思想链可能是事后的。当解码器从左到右生成其链时,我们在早期标记、中间标记和晚期标记处读取其隐藏状态,然后我们在晚期(判决时)状态上安装线性探针并将其应用于早期状态。所有三个隐藏状态都已经落入决策空间的有害区域内,并且探测置信度几乎没有变化。因此,判决在链被写入之前就已经确定,而后面的推理只是重述它。当我们对链进行重新采样时,多数判决仅在 ∼5%{\sim}5\% 的输入上发生变化(观察 1),推理成本约为 ∼100×{\sim}100\times。