32 位 LLM 法官值多少人?
How Many Humans Are 32 LLM Judges Worth?
摘要
面板的人体等效尺寸是针对特定目标的。将固定的 32 名法官小组与三个 ChaosNLI 任务上的经验人类标签分布进行匹配会产生两种不同的有效大小:分布误差匹配给出 $\nu_{\mathrm{MSE}}=2.304$、$3.750$ 和 $3.445$,而谱匹配给出 $\nu_H=4.242$、$6.459$ 和 $6.499$,差距为$1.72$--$1.89\times$;二进制错误诊断仅将 1.971 美元 - 2.227 美元的有效票归功于相同的小组。外推固定平方平均残差、平均成员方差和归一化平均协方差的分布误差曲线得出的渐近线为 $2.392$、$3.990$ 和 $3.655$,其中 32 名法官已经达到 $94.0$--$96.3\%$。精确的谱恒等式解释了这种差距:误差取决于成员能量以及相对于平均的剩余变化的方向,以及参与比率(PR)丢弃的信息。可实现的硬标签结构证实,即使在相等的成员能量和非负相关性下,较高的光谱多样性也可以与较差的分布恢复共存,并且共识方向保留$\gamma_{\mathrm{co}}=43.8\%$、$33.7\%$和$35.9\%$的中心残差方差。对 CC-1000(具有不同面板的 1,000 项民事评论子集)的外部检查给出 $\nu_H=2.84$。对于面板选择,我们建立了一个存在结果和一条可行路径:$k\in\{5,7\}$ 处的详尽枚举表明,在准确率和 $\nu_H$ 上都超过准确度-top-$k$ 基线的面板始终存在,并且贪婪地交换至多两个成员达到 $24.8$--$56.0\%$,比 $\nu_H$ 在 $0.10$--$1.10$ 的准确度上高出 $\nu_H$ 个百分点。我们的数据集和代码可在此 https URL 获取。