论文

LLM的偏好何时能预测下游行为?

When Do LLM Preferences Predict Downstream Behavior?

模型评测模型行为与机制分析

摘要

LLM的偏好驱动行为可能是“沙袋化”(sandbagging)等AI失对齐的必要前提:除非行为受其偏好影响,模型无法策略性地追求失对齐目标。然而既往工作通常显式提示模型以特定方式行动,观测到的行为究竟反映指令遵循能力还是底层模型偏好,并不清楚。本文检验这一失对齐前提是否存在。我们以实体偏好为行为探针,测量在五个前沿LLM上陈述的偏好能否预测三个领域的下游行为:捐赠建议、拒绝行为与任务表现。在概念上复制既往工作后,我们首先确认五个模型在两种独立测量方法下均表现出高度一致的偏好。随后我们在模拟用户环境中检验行为后果。我们发现五个模型都会给出与偏好一致的捐赠建议。被要求推荐捐赠时,五个模型也都表现出与偏好相关的拒绝模式,对不那么偏好的实体更常拒绝。我们观测到的所有偏好相关行为都在无任何“按偏好行事”指令的情况下出现。任务表现的结果则不一:在问答基准BoolQ上,两个模型出现小幅但显著的、偏向偏好实体的准确率差异;一个模型呈相反模式;两个模型无显著关系。在复杂Agentic任务上,我们没有发现偏好驱动性能差异的证据。LLM具有能可靠预测建议行为的一致偏好,但这些偏好并不一致地转化为下游任务表现。

LLM的偏好何时能预测下游行为?
图1:所有五个模型在两种独立测量方法下表现出高度一致的偏好。36个实体的Elo排名(来自成对比较)与直接模型排名(来自总体排名询问)之间的相关性。每个点代表一个实体。黑线为带95%置信区间(灰色带)的线性回归。Spearman相关系数(ρ=.91至.92)与p值显示在子图标题中。