论文
语言模型彼此一致,而不是与读者一致
Language Models Agree With Each Other, Not With Readers
摘要
语言模型同质化的说法通常是根据为研究收集的人类判断来衡量的,这使得人为设计的产物:接受模型指令的众包人员正在运行模型的提示。我们根据没有人为此目的构建的人类参考来衡量收敛性 - 120 个网络文档中的 2,523 个读者标记集,这些标记集是由人们出于自己的原因在平台上突出显示的,而其他标记的覆盖默认情况下是关闭的。一致性是两个大小匹配的句子集之间的重叠减去每个在其自己的深度和长度带内重新采样时预期的重叠。零值的校准是被证明的,而不是断言的:每对涉及随机基线的值都落在零的 0.006 以内。在中间文件中,双方各说出 14 个句子,共 70 个句子;两个读者共享 4.1,两个模型共享 8.7。在跨越 11 个供应商、3 个国家和两种权重开放方式的 18 个模型组中,153 个模型对的中位数为 +0.093,而人类标准为 +0.040,而 99 个模型对完全高于人类区间。来自竞争对手实验室的两个前沿模型达到了 +0.203,是 GPT-4o 在第二次通话中得出的结论的两倍。效果不是决定论、提示措辞、程序、供应商或路由,并且是分级的:最小的模型在人类水平上一致。没有哪个模型比读者更能明显地与读者达成一致,并且在相同的深度和长度下,没有任何表面特征可以区分他们的选择。倍数取决于程序,而顺序则不然:模型被剪切到最清晰的集合,而读者的模型是从他们标记的内容中随机抽取的,并且钝化模型同样将差距减半而不缩小差距。在分析后发布的四个模型上进行样本测试,与预先确定的预测相比,没有一个模型能够清除人类间隔。从多个模型模拟的种群并不是多个种群。