论文
Oracle 差距和信号保真度:用于测试时协作的固定池诊断
Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration
摘要
测试时协作,包括自我一致性、N 中最佳选择、批评模型和验证者管道,通常被认为可以广泛改进 LLM 推理,但其收益并不均衡,有时甚至是负面的。我们询问 无需训练 协作何时会有所帮助。对于固定的候选池,我们将选择器或验证器的净收益分解为可测量的因素:可恢复质量、验证信号覆盖范围、条件选择质量以及对已正确输出的损害。这将协作重新定义为候选选择问题,而不是多代理拓扑的固有属性。在 LiveCodeBench、MATH Level-5 硬科目和 GPQA-Diamond 中,增益首先受到预言机差距的限制,然后受到信号保真度的限制,我们直接将其衡量为验证者判决和官方标签之间的候选级一致性。在 LiveCodeBench 上,公共测试验证者 (MCC 0.825) 比第一个样本基线增加了 +8.14 个百分点 (pp);生成测试验证器 (MCC 0.248) 提高了 +2.70pp,并且在统计上与 LLM 选择器没有区别,但与选择器的 4.69% 危害率相比,其运行危害接近于零。在数学上,符号答案等价选择器比自洽性高出 +4.67pp,而 LLM 选择器则为负。在 GPQA-Diamond 上,可恢复质量仅为 3.03%,并且 87.54% 的候选池答案相同;较弱模型的池会进一步缩小,这表明预言机差距是任务、模型和采样配置的共同属性。我们的框架提供了实用的部署前诊断:估计预言机差距,然后在投资协作之前测量覆盖范围、信号保真度和危害。