论文
超越浅对准:后训练 方法如何确定拒绝电路和转向鲁棒性
Beyond Shallow Alignment: How Post-Training Methods Determine Refusal Circuits And Steering Robustness
摘要
用于训练语言模型拒绝有害请求的方法如何影响模型内部拒绝的实际运作方式?我们比较了三种 后训练 方法 - 监督 微调、推理增强 微调(对证明安全决策合理的推理链进行训练)和偏好优化 (ORPO) - 跨越三个架构不同的模型(Llama-3.1-8B、Gemma-2-9B、Qwen3-8B)。我们发现,训练方法(而不仅仅是数据)重塑了内部计算拒绝的方式:推理增强训练始终会产生一种独特的拒绝计算,在所有三个模型中都可见,而架构则独立地塑造内部结构以及如何可靠地引导拒绝。最重要的是,我们研究的任何方法都无法同时实现我们希望从安全对齐中获得的所有三个属性:不集中在少数脆弱组件中的拒绝、不牺牲一般能力的安全增益以及通过小型、有针对性的编辑可纠正的安全行为。我们警告不要将当前的 后训练 方法视为已解决的可靠防御,尤其是对于安全关键型用途。代码和模型可在 https://github.com/hoangcuongnguyen2001/Beyond-Shallow-Alignment 中找到。