论文

涌现对齐与伦理人设的可投影性

Emergent alignment and the projectability of ethical personas

模型评测模型行为与机制分析

摘要

关于“紧急失调”的研究表明,对狭窄任务的大语言模型进行微调可能会导致广泛的失调行为。这支持了“角色选择”(PSM)假设:在预训练期间,大语言模型学习模拟不同的角色和观点,这些可以在训练后被引出和完善。本文研究了相反的现象“紧急对齐”,并用它来支持和完善 PSM 并激发一种新的对齐需求。我们针对广泛和狭义的安全任务微调了一个仅有用的模型。为了创建 SFT 样本,我们遵循“人工智能宪法”(CAI)方法,并使用编码合理对齐策略的四种宪法:道义论、后果论、美德伦理以及使人工智能服从人类权威。对于这些模型中的每一个,我们都表明,对两个窄安全子类别的微调可靠地诱导了对一组代表性的一般安全类别的紧急对齐,以及对我们直接从用于窄对齐的数据集中过滤掉的安全子类别。为了使用更细粒度的评估来测试“PSM”,我们使用了多维“道德角色”诊断。对于每个宪法微调(广义/狭义)模型,我们评估它们的行为与预期签名配置文件的匹配程度。我们的结果表明,我们的 CAI 模型获得了预期的“道德角色”——例如,在使用结果主义宪法创建的 SFT 样本上进行微调的模型更符合功利主义而非道义论信念。然而,我们的粗粒度和细粒度评估表明,我们的(广义/狭义)微调 CAI 模型在预测效果方面存在显着差异。我们的结论是,应该评估调整策略,不仅要根据其(分布内)一般安全性能,还要特别根据其可预测程度。

涌现对齐与伦理人设的可投影性:论文配图
图 1:在评估一般安全性时,基于安全性能的分布内排名(广义 CAI 模型)与狭义模型(红色面板)的排名存在显着差异。同样,当对目标安全子类别进行评估时,基于安全性能的分布内排名(广义 CAI 模型)也与狭义模型的排名有很大不同。