论文

通过仪器干预建立比较动机概况

Building Comparative Motivation Profiles with Instrumental Interventions

模型评测模型行为与机制分析

摘要

安全评估通常从行为模式推断潜在动机,但这些推论的结构有效性尚不清楚。我们在对齐伪造中研究这个问题,其中模型在推断训练压力时更符合训练目标。这种行为通常被解释为战略性的自我保护,但它也可能反映了模型对进行评估的研究人员的期望的推断的敏感性。我们引入了一个对称干预框架来区分这些相互竞争的假设。我们不是直接干预“阴谋”或“阿谀奉承”,而是针对每个假设所涉及的工具过程:结果跟踪和研究人员期望跟踪。然后我们比较对这些过程的干预如何影响对齐伪造。我们使用合成文档 微调、激活引导和提示来研究四种开放量级模型生物体。根据综合文件 微调,Llama-3.1-70B、Llama3.1-405B 和 Qwen-2.5-72B 对期望跟踪比结果跟踪干预更敏感。 Llama-3.1-70B 上的激活转向支持相同的总体情况,并且及时干预与 SDF 概况大致一致。总体而言,尽管有一致的草稿本,但对齐伪造行为可能对评估上下文期望具有因果敏感性。因此,阴谋和战略欺骗评估需要结构有效性检查,而对称工具干预提供了这样一种测试。