论文
参考嫁接在引发沙袋功能方面与 微调 相匹配
Reference-Grafting Matches Fine-Tuning at Eliciting Sandbagged Capabilities
摘要
沙袋是指模型尽管保留了底层能力,但故意在评估中表现不佳,这威胁到了前沿模型治理所依赖的安全评估。启发游戏发现,微调 可以从沙袋模型生物体中引出隐藏的能力,而附加激活控制则失败。我们通过参考嫁接重新审视这一结论,即在主动学习选择的一小组电路中,沿着与诚实参考中所取值相反的方向设置激活坐标。在 11 个经过微调的密码锁定模型(1.5-32B,三个架构谱系)中,它恢复了 +94% 到 +101% 的诚实沙袋差距,匹配 微调 启发,无需权重更新或训练标签;两到五个配对的例子就足以符合这个方向。类似的恢复适用于强化学习引起的沙袋和密码锁定代码生成。嫁接之所以有效,是因为微调锁是一个阈值门:保留的精度保持在沙袋水平,直到嫁接坐标穿过诚实参考附近的阈值,这就是附加转向和坐标归零经常失败的原因。该方向跟踪沙袋是如何引发的,而不是被隐瞒的内容——符合小学科学(ARC),它引出了隐瞒的危险知识(WMDP),但提示、微调和强化学习各自具有不同的方向。熔断标志着边界:它会在每次前向传递时重新路由激活,因此我们测试的固定编辑会在下游重新中断,并且不会恢复连贯的生成。