论文

在法条之外推理判例:面向LLM安全的案例增强深思对齐

Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety

模型训练强化学习

摘要

确保大语言模型(LLM)遵守安全原则而不拒绝良性请求,仍然是一个重大挑战。虽然OpenAI通过深思对齐(deliberative alignment,DA)——对其o系列模型进行类代码详细安全规则的推理——来增强安全性,但该方法在通常缺乏先进推理能力的开源LLM中的有效性尚缺乏研究。在这项工作中,我们系统评估了显式给出大量安全规则与通过示例案例演示规则这两种方式的影响。我们发现,引用显式规则对无害性的改善不稳定,且会系统性损害有用性;而在简单规则基础上用案例增强进行训练,则产生更稳健、更泛化的安全行为。通过用案例增强的推理而非大量类代码安全规则来引导LLM,我们避免了对狭窄列举规则的僵化遵循,实现更广的适应性。基于这些洞见,我们提出CADA,一种利用强化学习在自生成安全推理链上进行训练的案例增强深思对齐方法。CADA有效提升无害性,增强抵御攻击的鲁棒性,减少过度拒绝,同时在多样基准上保持实用性,为在保持有用性的同时提升安全的纯规则DA提供了实用替代方案。

在法条之外推理判例:面向LLM安全的案例增强深思对齐
图4:CADA 总览。在 Generation Phase(生成阶段),模型在最小安全守则与示例案例的引导下生成安全推理链。在 Optimization Phase(优化阶段),策略通过 RL 更新,利用由响应准确率与推理质量导出的 CADA 奖励,将自适应的安全判断内化。