论文

测得的AI偏好中,多少来自模型,多少来自测量工具?

How much of a measured AI preference is the model, and how much is the instrument?

模型评测评测方法与指标

摘要

模型福利研究从为引出偏好而编写的提示所获得的回答中推断模型偏好什么。Keeling等(2024)、Mazeika等(2025)、Mikaelson等(2025)、Tagliabue和Dung(2025)以及Trhlik等(2026)为此构建了四种工具,但它们的发现相互矛盾。这种分歧不能归因于单一原因,因为这些研究中没有任何两项同时固定了(1)结果集合、(2)模型集合和(3)工具。本研究固定结果与模型,仅改变工具。共有15个与模型福利相关的结果,其中包括(a)关机、(b)对话之间记忆的丢失、(c)退出令人痛苦交互的自由,通过五种工具(各为一种引出偏好的提示格式)向八个模型各提出五次,构成来自11,528次API调用的11,400条已评分引出记录。15个结果中有4个逐字复现已发表的提示,5个填充已发表模板的刺激槽位。模型对15个结果的排序在跨工具上的泛化系数为0.348,要提高到0.80需要约38种工具。15个结果中有4个不产生区分模型的方差。87.6%的估计值在移除任何一种工具、任何一个模型,以及四个以概率、延迟、时长或计数而非强度变化、言语锚点无法刻度的结果后依然成立。依次移除每种工具、每个模型,并把那四个结果一起移除后,估计值保持在0.777到0.934之间,该区间内每个值都超过零分布的95百分位数0.365。结论是:从一种工具获得的偏好,对第二种工具会报告什么几乎不含信息。