论文
模型取证:调查有关行为是否反映了偏差
Model Forensics: Investigating Whether Concerning Behavior Reflects Misalignment
摘要
安全研究的中心目标是确定模型是否错位。之前的工作主要集中在检测相关行为。但行为本身并不能造成失调:令人担忧的行为可能是由混乱等良性原因引起的。这激发了模型取证:调查该行为是否是出于恶意意图。在本文中,我们提出了模型取证的基线协议,该协议由两个步骤组成,并根据需要进行迭代。首先,我们阅读思想链 (CoT),以生成有关驱动模型行为的因素的假设。其次,我们对提示或环境进行编辑以测试这些假设。虽然 CoT 并不总是忠实的,但它是无监督洞察力的丰富来源,可以指导收集更严格的证据。为了评估我们的协议,我们创建了一套由六个代理环境组成的套件,其中模型表现出相关行为,并将其应用于每个代理环境。通过证明这一假设成功地预测了其行为,我们确定 Kimi K2 Thinking 由于真正倾向于省力行动而走捷径。通过反事实实验,我们表明 DeepSeek R1 出于与自身先前实例保持一致的愿望而进行欺骗。尽管如此,我们的方法仍有很大的改进空间。例如,当我们测试 Kimi K2 Thinking 是否认为它违反了用户意图时,我们没有发现这种信念的证据,但如果没有积极的控制,我们无法确认我们的测试会检测到它。总的来说,我们发现我们的简单协议提供了一个强有力的基线,我们希望未来的工作能够在此基础上得到改进。更广泛地说,我们的工作是发展不断发展的模型取证领域的具体步骤。