论文
对关键一票视而不见:聚合独立性指标错过验证真正起作用之处
Blind to the Pivotal Vote: Aggregate Independence Metrics Miss Where Verification Actually Helps
摘要
LLM评判面板是常用的评估工具,但先前工作报告了高度相关的面板错误:九个评判者提供大约相当于两个独立评判者的有效信息,而聚合仅能弥合其中一小部分差距。一个自然的补救手段——引入来自不同证据源的信号,例如执行测试套件——在大规模实验中并未给面板的有效票数带来可辨别的变化(-0.04,95% CI [-0.10, +0.02])。聚合依赖性与条件决策效用是两个不同的问题。基本的多数票算术确定了单票替换的受影响集合:只有以一票之差决定的情形才可能改变。实证问题在于面板错误率是否在这些查询上更高、有用的替换是否集中于此。事实正是如此:全部准确率增益都集中在这些关键查询上,且增益可观(三个主要配置中为+10.4至+23.3个百分点),而在其他查询上恰好为零。我们在三个代码基准和四种面板规模(9评判者扩展与56次依赖子采样检查,增益+6.5至+16.1个百分点)上确认了这一模式。在HumanEval+/MBPP+上,多数侧替换规则将整体准确率从82.44%提升到85.62%,同时仅在16.2%的查询上调用信号;仅用信号仍然更强,达87.60%。因此,总体层面的依赖性诊断与按边际分层的效用是互补的,且受影响集合的刻画为任何给定的单票替换策略提供了调用削减规则。
