论文

注意差距:引出协议如何塑造语言模型中陈述-揭示偏好差距

Mind the Gap: How Elicitation Protocols Shape the Stated-Revealed Preference Gap in Language Models

模型评测模型行为与机制分析

摘要

近期工作发现语言模型(LM)中存在陈述-揭示(SvR)偏好差距:模型认可的价值观与其在上下文中所做选择之间的不匹配。现有评估严重依赖二元强制选择提示,把真实偏好与引出协议的伪影纠缠在一起。我们系统研究引出协议如何影响24个语言模型上的SvR相关性。在陈述偏好引出时允许中立与弃权,使我们能排除弱信号,显著提升主动陈述偏好与强制选择揭示偏好之间的Spearman秩相关(ρ)。然而,若进一步允许在揭示偏好中弃权,由于高中立率,ρ降至接近零或负值。最后,我们发现用陈述偏好在揭示偏好引出期间进行系统提示引导,并不能可靠地改善AIRiskDilemmas上的SvR相关性。总之,我们的结果表明SvR相关性高度依赖协议,偏好引出需要能够处理不确定偏好的方法。

注意差距:引出协议如何塑造语言模型中陈述-揭示偏好差距
图4:系统提示转向(System Prompt Steering)的影响。在使用模型自身的扩展选项陈述性偏好排名、于系统提示转向下引出显示性偏好时,Spearman's ρ 的变化。绿色点(steered)位于灰色点(baseline)左侧表示 SvR 相关性降低。