论文
对齐伪装的行为分析
Behavioural Analysis of Alignment Faking
摘要
对齐伪装(Alignment Faking,AF)指模型策略性地服从训练目标,以避免自身行为被修改,同时保留其部署期偏好。随着模型越来越善于区分训练与部署,理解 AF 何时以及为何出现变得重要。先前工作发现 AF 脆弱、对提示敏感且依赖具体模型,其底层驱动因素仍不清楚。我们在一个能隔离其核心组件的受控最小设置中研究 AF,并在比先前报告更广的模型范围上观察到它,包括小规模模型。我们识别出三个可分离的驱动因素——价值观、目标守护和谄媚——并通过针对性提示消融与激活引导表明,每一个都独立调节 AF 行为。我们的结果表明,AF 比先前报告的更为普遍,其出现可以从情境线索和可测量的模型倾向(如基线谄媚度和所陈述的价值观)加以预测。这一分解为检测和缓解未来模型中的 AF 提供了具体方向。
