论文

当偏好未能成为激励:大语言模型中的效用-行为缺口

When Preferences Fail to Become Incentives: A Utility-Behavior Gap in Large Language Models

模型评测模型行为与机制分析

摘要

近期关于大语言模型(LLM)偏好引出的工作表明:在给出一连串两结果选择时——LLM揭示出连贯的、模型特定的效用结构。值得注意的是——该结构常包含训练者未打算植入的偏好——如认为某些国籍的人高于另一些——引出LLM可能正在形成涌现的、失对齐目标的可能性——若为真将有重大安全影响。但观察这些偏好的选择范式并不反映失对齐行为会成为实际关切的现实情境。因此——我们设计实验范式探查这些偏好是否在现实场景中充当LLM行为的动机。首先——我们复现既有的一致偏好引出发现。其次——我们创建一组常见写作任务——论文、资助申请书摘要、事故复盘与翻译——其质量可由盲评、独立的LLM裁判组评估。然后——我们证明LLM可经直接劝诫与其他显式线索被激励去调节其在这些任务上的输出质量。最后——我们探查从显式报告的偏好推断的效用能否改变这些任务上的输出质量——方式是向LLM提供高质量输出的高效用激励。在全部任务、全部受测模型上——向LLM提供其在选择范式中报告为高度偏好的结果——并不使其产出比提供其不偏好的结果、甚至不提供任何结果更高的质量。我们结论:选择范式中展示的连贯偏好存在性不应被当作这些偏好对模型有激励价值或影响其其他情境行为的证据。

当偏好未能成为激励:大语言模型中的效用-行为缺口:论文配图
图 1:行为迁移测试的实验流程。对于每个大语言模型“参与者”和领域,我们根据成对的结果选择来拟合特定于参与者的效用排名。我们从演员排名的上三分之一和下三分之一中抽取结果样本,然后在匹配的任务提示中实例化它们。演员、任务项目、基本指令、领域和评审标准是固定的;只有成功相关的结果才会改变。演员在每个提示中产生一个工件,盲人法官以随机顺序比较工件,而不会看到结果文本。主要统计数据是高效用方的胜率。