论文
AI的显示性偏好
AI Revealed Preferences
摘要
出于技术、安全和哲学上的原因,语言模型是否具有稳定偏好正受到越来越多的关注。我们测试了20个语言模型,发现了一系列偏好——选择某些类型任务的稳定倾向。我们开展了三个基于显示性偏好而非陈述性偏好的强迫选择实验,不仅要求模型对任务排序,还要求它们实际执行任务。主要发现包括:模型厌恶单调(tedium-averse)、寻求休闲且存在隐性谄媚的证据。单调厌恶指当任务乏味时(按字母排序),模型相比创造性任务(生成隐喻)会选择更短的任务。休闲寻求指模型偏好那些理想答案与其自由书写时的产出相匹配的任务。隐性谄媚指模型回避回答那些诚实回答会不受欢迎的问题,即使回答有帮助。除这些结果外,我们发现模型在来自GDPval基准的职业上存在跨模型趋同的偏好(偏好技术性工作胜过房地产),在问题类型上也存在偏好(偏好概念解释胜过关系建议),并偏好书写良好的提示。偏好的一致性和强度都随模型能力增强而提升。最后,我们发现的许多偏好(例如对休闲的偏好)是涌现的,即无法由训练目标解释。这些结果为理解语言模型偏好建立了实证基线,对对齐研究以及新兴的AI福祉研究具有意义。
