论文
当偏好未能成为激励:大语言模型中的效用-行为缺口
When Preferences Fail to Become Incentives: A Utility-Behavior Gap in Large Language Models
摘要
近期关于大语言模型(LLM)偏好引出的工作表明:在给出一连串两结果选择时——LLM揭示出连贯的、模型特定的效用结构。值得注意的是——该结构常包含训练者未打算植入的偏好——如认为某些国籍的人高于另一些——引出LLM可能正在形成涌现的、失对齐目标的可能性——若为真将有重大安全影响。但观察这些偏好的选择范式并不反映失对齐行为会成为实际关切的现实情境。因此——我们设计实验范式探查这些偏好是否在现实场景中充当LLM行为的动机。首先——我们复现既有的一致偏好引出发现。其次——我们创建一组常见写作任务——论文、资助申请书摘要、事故复盘与翻译——其质量可由盲评、独立的LLM裁判组评估。然后——我们证明LLM可经直接劝诫与其他显式线索被激励去调节其在这些任务上的输出质量。最后——我们探查从显式报告的偏好推断的效用能否改变这些任务上的输出质量——方式是向LLM提供高质量输出的高效用激励。在全部任务、全部受测模型上——向LLM提供其在选择范式中报告为高度偏好的结果——并不使其产出比提供其不偏好的结果、甚至不提供任何结果更高的质量。我们结论:选择范式中展示的连贯偏好存在性不应被当作这些偏好对模型有激励价值或影响其其他情境行为的证据。
