论文
思考词元有助于安全吗?
Do Thinking Tokens Help with Safety?
摘要
今天的推理模型使用思维标记来获得比指令调整的对应模型更强的基准性能。人们还普遍认为,这种更加“深思熟虑”的模式应该通过为模型提供一个安全的空间来考虑其对请求的计划响应是否违反其安全原则,从而提高一致性和安全性。我们提供的证据表明这种直觉并不总是正确的。在涵盖 GPT-OSS、Qwen、Olmo 和 Phi 系列的前沿开放权重推理模型中,我们发现,在任何可见的思考之前,通过第一个词元的隐藏表示($0.84$-$0.95$ AUROC 和 $\sim88\%$ 平衡预测拒绝/合规的准确性)上经过训练的头脑,最终的拒绝/合规结果已经是可以强烈预测的。事实证明,思考过程更类似于前缀完成,而不是深思熟虑的修订,尽管在文本级别上给出了深思熟虑的外观,但在第一个 $\sim20\%$ 思考之后,最终结果很少改变($\sim74\%$ 的文本级别深思熟虑发生在响应分布已经锁定到拒绝/遵守一侧时)。我们还发现,现有的推理时间和基于训练的安全干预措施,尽管是出于诱导深思熟虑的目标,但在很大程度上将模型行为转向过度拒绝,同时抑制了已经稀缺的深思熟虑信号。我们的结果表明,当前推理模型中的安全行为远不如通常假设的深思熟虑,并强调需要诱导真正的安全深思熟虑的方法。