论文

首个Token至关重要:理解大型推理模型的安全坍塌

First Token Matters: Understanding Safety Collapse in Large Reasoning Models

模型推理解码与生成控制

摘要

大型推理模型展现较强问题求解能力,但处理有害查询时安全对齐往往退化。现有改进方法主要依赖额外训练或偏好优化,对安全失效内部机制的理解有限。本文通过token级位置分析研究拒绝动态,发现推理起点的局部脆弱性,并称其为起始拒绝坍塌ORC。有害查询下,大型推理模型的拒绝相关信号在首个生成token处急剧下降,与不安全回答生成相关。基于这一发现,我们提出轻量推理时干预SafeToken,在推理起点精确注入学习到的连续安全锚点。尽管只更新一个token嵌入,SafeToken仍能有效缓解ORC,改善有害查询基准上的安全性,并基本保留推理实用性。结果提示,大型推理模型的安全失效可能源于理解到生成这一关键转换处的短暂崩溃。

首个Token至关重要:理解大型推理模型的安全坍塌:论文配图
图1:研究工作总览。