论文

定位和解锁模型生物中沙袋的因果模型

A Causal Model for Locating and Unlocking Sandbagging in Model Organisms

模型评测模型行为与机制分析

摘要

沙袋模型在战略上在评估中表现不佳,同时保留了被测量的能力。指导前沿模型部署和治理的评估低估了这些模型的作用。为了理解这一机制,我们提出了一个关于残流中沙袋如何携带的因果模型。早期层将沙袋意图写入流的单个轴上,后面的层读取该轴并提交答案。我们研究了三种指令调整模型(Qwen2.5-7B、Llama-3-8B 和 Mistral-7B)和四种安装沙袋锁的方法(提示、微调、强化学习和熔断)。每把锁都会根据提示来决定是否沙包,而经过微调和断路的锁只要出现密码就会诚实地回答。因果模型预测在最后一次沙袋写入之后和答案提交之前的层窗口,其中沙袋轴的单层参考移植到其诚实值可以恢复全部功能。在经过提示、微调和 RL 训练的锁的 33 次运行中,单层移植物在 28 次中恢复了能力,中位保留恢复率为 96%。断路锁通过一层带重写整个状态,单层移植在每一层都会失败。因此,我们引入了第二种干预措施,即上下文移植,它会重播密码的缓存键/值激活,以便每一层的注意力将它们读取为附加上下文。上下文嫁接可根据经验证明恢复所有三种模型的全部功能,并且恢复对确切的密码内容令人惊讶地不敏感。更广泛地说,审计人员可以使用这种因果模型来设计沙袋模型的干预审计技术。