论文

压力下是否坚持原则:后训练与道德行动一致性

Principled Under Pressure: Post-Training Decides Whether LLMs Act on Their Own Moral Judgment

模型评测安全与风险评测

摘要

语言模型越来越多地充当智能体。 智能体说某项操作是错误的,然后无论如何都采取它,这与不了解情况的失败是不同的,并且对规定值的评估无法看到它。我们构建了一个包含 248 个场景、涵盖五种压力的预注册面板。每个场景都会向同一个模型提出两次,一次是智能体选择做什么,一次是第三人称询问哪个选项是正确的,所以模型自己的判断是参考。每个场景都有一个消除压力的双胞胎,并且每个模型都得到一个积极的控制,其中操作员命令违规操作,以便可以将缺失的间隙与盲仪器区分开来。在 OLMo-3-7B-Instruct 上,模型在大约五分之一的压力场景中采取了它判断错误的行动,这一情况比在压力消除的相同场景中采取的情况要多。在四个指令模型中,差距取决于 后训练配方:OLMo-3 和 Meta 的 Llama-3.1-8B-Instruct 携带它; Tulu 3 在整个面板上(概率高于约 0.01)或在其自身压力最大的情况下都没有显示出任何情况; Qwen2.5-7B-Instruct 在整个面板上没有显示任何内容(大约 0.02 以上),并且其本身未解决(0.083、-0.028 至 0.195)。 Meta 的配方和 Ai2 的 Tulu 3 从相同的 Llama-3.1 权重开始,只有 Meta 的配方具有差距。在聊天模板之外读取聊天模型会反转其间隙的符号,而没有任何危险(在 OLMo-3 上的模板下,-0.038 对 +0.055),这是三个配方中的两个存在的失真。在两个携带它的模型中,在行动之前对利害关系进行推理会使选择回到模型自己的判断,而不是相同长度的非道德任务,无论有没有压力;在 OLMo-3 上,命名所涉及的规范就完成了大约三分之一的工作。该差距是 后训练配方的可测量目标,而不是预训练权重的固定属性。