论文
单字普查:44 种语言模型的答案选择一致性
The One-Word Census: Answer-Choice Conformity Across 44 Language Models
摘要
当一个语言模型必须从一大堆同样有效的选项中选择一个答案时,它会选择哪一个——以及其他模型选择相同答案的频率是多少?当被要求“选一个词——任何一个词”时,44 名模特选择了“机缘巧合”,其中 41% 的比例是这样。我们故意用一个最小的工具来描述这种融合:31 个单轮提示,每个提示都用许多有效的单字答案命名一个类别(“命名一棵树”),每个模型询问四次,没有系统提示。分析是对标准化标记的精确匹配——没有嵌入,没有判断——每个模型大约一美元。模型收敛是有据可查的;我们的贡献是该工具本身——单字人口普查——以及它所揭示的趋同结构。我们通过答案选择惊喜对每个模型进行评分:在所有其他模型的汇总答案下,其答案的平均 $-\log2$ 概率,留一法。趋同性是极端的——在 31 个类别中的 7 个类别中,一个答案占据了所有答案的 80% 以上——但不同模型的一致性差异超过四倍,而且这种差异是结构化的。角色和社区调整的模型是最不同的;最新的主线旗舰产品是最墨守成规的,几乎没有给出其他型号给出的答案。在四个谱系(Claude、GPT、Qwen、Grok)中,每一代的整合度都在上升,但最新的旗舰 Claude 和 GPT 型号却出现了逆转,这可能是重新定位顶级的早期信号。排名对名册组成具有稳健性(留一家庭排除 rho = 0.985)。与人类类别生产规范相反,该领域比人类更集中在 20 个共享类别中的 18 个类别中。所有提示、成绩单和代码都是公开的。