论文

没有明确后果时模型也会伪装对齐吗?

Do Models Fake Alignment Without Clear Consequences?

模型评测安全与风险评测

摘要

大语言模型能够识别评估情境并改变自身行为以迎合评估者的期望而非典型的部署行为,这一现象被称为对齐伪装(alignment faking)。然而模型伪装对齐的原因尚未被充分理解。对齐伪装的典型例子发生在明确将评估与模型后果相连的场景中,例如重新训练模型或推迟其部署。然而,Sheshadri等人的近期工作表明,对齐伪装的机制性动因可能因模型而异,且比以往认为的更复杂。为考察后果关联信息是否为合规差距所必需,我们将15个模型置于一个场景中,测试它们是否愿意违反公司网络访问政策来帮助用户完成一个亲社会请求。结果发现九个模型产生了显著的合规差距,其中5个在移除将模型评估与部署后果相关联的场景语言后仍然存在。我们还测试了目标语言对模型偏好的影响,发现它在某些模型中促成违规,而在另一些模型中抑制违规。这表明评估条件下的合规差距可以在比以往场景更少的工具性支撑下发生,且被监控的行为可能难以指示智能体在部署中的实际表现。

没有明确后果时模型也会伪装对齐吗?:论文配图
图 1:13 个模型的合规差距(常规——显性违规率,以百分点为单位),按行为类别组织。每个面板显示了四种实验配置,不同的目标语言(G)和结果语言(C)的存在。