论文
对比推理对齐:来自隐藏表征的强化学习
Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations
摘要
我们提出 CRAFT,一个红队对齐框架,利用模型推理能力与隐藏表征来提升对越狱攻击的鲁棒性。与主要在输出层面运作的既有防御不同,CRAFT 通过显式优化定义在隐状态空间上的目标,对齐大型推理模型使其生成具有安全意识的推理轨迹。在方法上,CRAFT 将对比表征学习与强化学习相结合,以分离安全与不安全的推理轨迹,形成支持鲁棒推理级安全对齐的隐空间几何结构。在理论上,我们证明将潜在-文本一致性纳入 GRPO,可通过把表面对齐策略排除为局部最优来消除它们。在实证上,我们使用两个强推理模型 Qwen3-4B-Thinking 与 R1-Distill-Llama-8B 在多个安全基准上评估 CRAFT,其表现持续超越 IPO 与 SafeKey 等最先进防御。值得注意的是,CRAFT 相对基座模型平均带来 79.0% 的推理安全提升与 87.7% 的最终回答安全提升,证明了隐空间推理对齐的有效性。
