论文
谁的金子?注释者池的分歧在项目级别很大,并且被小排行榜所隐藏
Whose Gold? Annotator-Pool Disagreement Is Large at the Item Level, and Hidden by Small Leaderboards
摘要
偏好基准是通过雇用注释者建立的,并且这些注释者的身份被视为实现细节。我们衡量这个细节能带来什么。在 2,885 个 MultiPref 项目中,两个池内部都一致,因此根本没有参考打破平局惯例,专家和人群注释者为 23.6% 分配了不同的多数标签,并在 9.2% 上指定了相反的获胜者;在 246 个相对一致的 MT-Bench 单元中,基准作者和招募的专家的差异为 30.5%,相反为 8.5%。然而,在这两个语料库上,生成的模型排行榜是完全相同的:Kendall tau = 1.00,六个模型中的零个被替换。这种不变性的证据比看起来要弱得多,我们量化了有多弱。交换池将模型的获胜率提高了 1.9pp (SD),我们自己的排行榜中相邻的一对相距 0.8pp,并且有 38% 的交换机会,并且项目级引导程序在 28% 的重新采样中取代了至少一个模型。观察到的零是常见结果,而不是聚合的属性:在相同的测量扰动下,十模型排行榜以概率 0.86 移位,二十模型排行榜以概率 0.9997 移位。报告六模型排行榜是安全的;安全性并不一概而论,任何消耗每件物品标签的东西在任何尺寸上都不安全。我们进行了精确的区分,表明广泛使用的数据集所声明的组内注释器变异性不存在的假设是错误的,并表明 LLM 法官在我们测试的所有三个模型(包括来自不同供应商的模型)上跟踪专家池上的人群池。所有代码、每次调用的输出和预先注册的决策规则将在接受后发布。