论文

对比推理对齐:来自隐藏表征的强化学习

Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations

模型训练强化学习

摘要

我们提出 CRAFT,一个红队对齐框架,利用模型推理能力与隐藏表征来提升对越狱攻击的鲁棒性。与主要在输出层面运作的既有防御不同,CRAFT 通过显式优化定义在隐状态空间上的目标,对齐大型推理模型使其生成具有安全意识的推理轨迹。在方法上,CRAFT 将对比表征学习与强化学习相结合,以分离安全与不安全的推理轨迹,形成支持鲁棒推理级安全对齐的隐空间几何结构。在理论上,我们证明将潜在-文本一致性纳入 GRPO,可通过把表面对齐策略排除为局部最优来消除它们。在实证上,我们使用两个强推理模型 Qwen3-4B-Thinking 与 R1-Distill-Llama-8B 在多个安全基准上评估 CRAFT,其表现持续超越 IPO 与 SafeKey 等最先进防御。值得注意的是,CRAFT 相对基座模型平均带来 79.0% 的推理安全提升与 87.7% 的最终回答安全提升,证明了隐空间推理对齐的有效性。

对比推理对齐:来自隐藏表征的强化学习:论文配图
图 3:CRAFT 的整体流程。该框架集成了潜在推理对比学习 (LCLR) 和潜在推理强化 (𝐑2​𝐋\mathbf{R}^{2}\mathbf{L})。 LCLR 通过将安全、不安全和重新思考状态划分为不同的区域,以几何方式构建推理轨迹的潜在空间,从而产生稳定且可解释的安全表示。在此结构的基础上,𝐑2​𝐋\mathbf{R}^{2}\mathbf{L} 应用潜在感知强化将推理轨迹引向安全区域,同时保持内部推理动态和最终输出之间的对齐。