论文
ConsisGuard:在 LLM Guardrails 中使安全审议与政策执行保持一致
ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails
摘要
基于推理的 LLM 护栏通过在发布最终决定之前生成明确的理由来改进安全审核。然而,他们的理由并不总是导致忠实的执行:模型可能会在其推理中识别出有害意图,但仍然预测安全标签,或者在没有基于政策的理由的情况下发布不安全的决定。我们将这种安全关键型故障模式定义为审议与执行之间的差距。与一般的思想链忠实性不同,护栏可靠性要求策略执行的一致性:生成的推理应该以安全策略为基础,并且最终的决策应该由该推理得出。我们提出了 ConsisGuard,这是一种用于基于推理的 LLM 护栏的一致性感知框架。 ConsisGuard 执行策略到决策轨迹 蒸馏 和功能耦合对齐,从而调整安全审议和决策执行之间的内部耦合。提示和响应危害性检测基准的实验表明,ConsisGuard 提高了检测性能,同时减少了策略执行失败。这些结果表明,可靠的基于推理的护栏需要准确忠实地执行安全策略。