论文
通过反对齐少样本会话暴露实现LRM对齐
Alignment of LRMs via Counter-Aligned Few-Shot Conversation Exposure
摘要
大型推理模型(LRM)依赖显式思维链(CoT)推理与超大上下文窗口在复杂任务上取得强劲表现,但这些特性也引入了新的攻击面。我们展示,通过在前面拼接包含显式CoT轨迹的反对齐少样本会话,LRM的推理过程可被系统性引导,导致在有害查询上生成不安全内容、在良性查询上产生无端拒答。我们将这一攻击形式化为SRCF(Steering Reasoning via Counter-Aligned Few-shot Conversations),它仅通过灵活的会话接口运作,无需访问模型参数与梯度。我们的关键洞见是,SRCF利用了一个对抗性泛化问题,引发表示漂移,使良性输入与有害输入的表示朝相似方向偏移。这一观察激发了我们的后训练防御ARCF(Aligning Reasoning via Counter-Aligned Few-Shot Conversations),它让模型暴露于反对齐会话上下文的同时强制对齐目标。ARCF与现有后训练方法兼容,并在不损害实用性的前提下持续提升安全性与有用性。
