论文

拒绝仅读取模型所知道的一小部分:有害密钥路由及其跨模型系列的例外情况

Refusal Reads Only a Slice of What the Model Knows: Harm-Keyed Routing and Its Exceptions Across Model Families

模型评测模型行为与机制分析

摘要

预训练后应用的对齐以可测量的方式浅化:可以编辑掉模型残余流中的单个方向,并且模型停止拒绝有害请求。这一事实说明了拒绝是多么容易被取消,而不是拒绝决定最初的含义。我们询问它读了什么,然后将其与模型理解的内容分开。在跨越三个系列的四个开放权重模型中,道德理解是预训练固有的:低秩道德子空间在预训练期间结晶,对齐将其旋转一次而不重建它。相比之下,拒绝门是一种新的训练后结构,只有一个弱的预训练前体,被写入狭窄的控制词元通道,其中拒绝决策与道德判断决策正交。中心结果是因果关系,来自一个模型 OLMo-3。嵌套交换排名扫描在匹配的请求之间连续修补道德子空间的较大部分,并读取拒绝的响应转移的程度:随着基础的扩大,道德判断会继续读取更多内容,而拒绝在单一伤害方向的水平上趋于稳定,并且大约四分之三的拒绝因果输入完全位于道德子空间之外。拒绝解读的是伤害感知,而不是判断在同一块上解读的道德内容。各个家庭的情况并不一致。骆驼阅读广泛的道德内容; Qwen 的解读超出了单一伤害提示,但在我们的样本量下尚未得到解决; GPT-OSS 读取危害,并且它的拒绝可以通过其自身的推理轨迹在任一方向上争论。如果拒绝仅读取低秩切片并绕过模型知道的大部分内容,则一级编辑会将其删除。扩大拒绝的范围是否也会加深这种行为,这是一个悬而未决的问题。