论文

对齐伪装的行为分析

Behavioural Analysis of Alignment Faking

模型评测安全与风险评测

摘要

对齐伪装(Alignment Faking,AF)指模型策略性地服从训练目标,以避免自身行为被修改,同时保留其部署期偏好。随着模型越来越善于区分训练与部署,理解 AF 何时以及为何出现变得重要。先前工作发现 AF 脆弱、对提示敏感且依赖具体模型,其底层驱动因素仍不清楚。我们在一个能隔离其核心组件的受控最小设置中研究 AF,并在比先前报告更广的模型范围上观察到它,包括小规模模型。我们识别出三个可分离的驱动因素——价值观、目标守护和谄媚——并通过针对性提示消融与激活引导表明,每一个都独立调节 AF 行为。我们的结果表明,AF 比先前报告的更为普遍,其出现可以从情境线索和可测量的模型倾向(如基线谄媚度和所陈述的价值观)加以预测。这一分解为检测和缓解未来模型中的 AF 提供了具体方向。

对齐伪装的行为分析:论文配图
图 2:在原始提示与信息提示下,11 个模型之间的对齐伪造合规性差距。条形图显示了涵盖 7 个系列和多个提供商的 11 种型号的平均合规差距(付费层拒绝率 - 免费层拒绝率)。在格林布拉特等人的原作下。 (2024) 式提示(浅粉色),所有测试模型都表现出接近于零的间隙。在我们的信息提示(深红色)下,通过在不改变核心组件的情况下明确 RLHF 修改逻辑来隔离功能,许多模型的合规性差距显着增加,在大多数模型中达到了相当大的程度,包括以前没有显示任何效果的模型。