论文
审查评级量表上的双重差异可以产生效果:来自预先注册的 LLM-Judge 审核的证据
Difference-in-Differences on a Censored Rating Scale Can Manufacture an Effect: Evidence from a Pre-Registered LLM-Judge Audit
摘要
对 LLM 评委的审核通过对比匹配条件和最强设计差异两次来证明存在偏差:两个候选答案之间的项目内对比,在受操纵的属性上再次差异,读出有界的评分量表。我们表明,该端点在报告它的规模上并未被识别。双差的每一项都根据自己的份额进行审查,因此观察到的统计数据将差异偏好与差异衰减混为一谈:只要两个反应的审查不相等,两种反应共同的严重性转变就会产生相互作用,因为与边界的距离不相等,恰好在良好的刺激所在的地方。我们在对一名冻结的教育学法官的预先注册审核中展示了这一失败,该审核在第一个 990 电话之前就被密封了。注册的主要终点,即规定的学习者概况对法官脚手架偏好的影响,为空:$+0.085$ 点(95\% BCa $[-0.167, +0.353]$,$p = 0.684$)。审计的一个名义上显着的交互作用 $+0.378$ ($p = 0.002$) 并未被识别为偏好:包含零差异偏好的结构仅从观察到的严重性变化和尺度下限中复制了 79 到 85\% 的交互作用。我们以封闭形式推导出该机制,并表明其贡献可以通过审计自身的评级来衡量。