论文

通过反对齐少样本会话暴露实现LRM对齐

Alignment of LRMs via Counter-Aligned Few-Shot Conversation Exposure

模型训练监督微调与指令调优

摘要

大型推理模型(LRM)依赖显式思维链(CoT)推理与超大上下文窗口在复杂任务上取得强劲表现,但这些特性也引入了新的攻击面。我们展示,通过在前面拼接包含显式CoT轨迹的反对齐少样本会话,LRM的推理过程可被系统性引导,导致在有害查询上生成不安全内容、在良性查询上产生无端拒答。我们将这一攻击形式化为SRCF(Steering Reasoning via Counter-Aligned Few-shot Conversations),它仅通过灵活的会话接口运作,无需访问模型参数与梯度。我们的关键洞见是,SRCF利用了一个对抗性泛化问题,引发表示漂移,使良性输入与有害输入的表示朝相似方向偏移。这一观察激发了我们的后训练防御ARCF(Aligning Reasoning via Counter-Aligned Few-Shot Conversations),它让模型暴露于反对齐会话上下文的同时强制对齐目标。ARCF与现有后训练方法兼容,并在不损害实用性的前提下持续提升安全性与有用性。

通过反对齐少样本会话暴露实现LRM对齐:论文配图
图 1:所提出的 SRCF 攻击与 ARCF 后训练框架示意图。左图:在 SRCF 攻击下,输入查询前会拼接包含反对齐 CoT 的少样本对话,导致对良性查询的过度拒答或对有害查询的不安全生成。右图:ARCF 训练模型在对齐监督下从含反对齐内容的少样本对话中恢复正确行为,从而同时提升 LRM 的有用性与安全性。