论文
超越单一方向:思维链干扰对拒绝行为的简单转向控制
Beyond a Single Direction: Chain-of-Thought Disrupts Simple Steering of Refusal
摘要
大型推理模型(LRM)在生成最终输出之前会先产生思维链(CoT)轨迹,引入了一种动态内部状态,可能使拒绝(refusal)等控制机制复杂化。与指令微调LLM中拒绝由单一方向子空间介导不同,大型推理模型(LRM)中的拒绝还额外依赖CoT。在DeepSeek-R1-Distill-LLaMA-8B中,当CoT保持固定时,激活转向仅在39%的案例中逆转拒绝;而完全移除CoT会将该比例提高到70%,表明CoT在主动强化拒绝。在一个两阶段干预(模型在激活转向下重新生成其CoT)中,拒绝在94%的案例中被逆转;即便在移除转向之后,所得的CoT单独仍保留该效应的48%。这表明CoT能够独立地承载并重建顺从信号。这些发现表明,LRM中的拒绝被共同编码在残差流激活与CoT之中。这种联合激活使LRM对仅靠激活层面的干预更加鲁棒,但使CoT暴露于一种可能的替代性攻击面。