论文
LLM 评审小组的有限校准机制图
A Finite-Calibration Regime Map for LLM Judge Panels
摘要
部署 LLM 评审小组需要花费人工标签来安装校准器、构建候选评审路径以及验证要部署的候选者。我们研究有限标签何时应支持低维堆叠器或可靠性模型,以及何时无限制的联合输出表值得其单元数和看不见的模式成本。我们将其转换为有限校准体系图,并将其实例化为有限校准面板选择(FCPS)、判断路径、部署面板大小和支持诊断的聚合器系列的验证选择器。在 RewardBench、LLMBar、SummEval 和具有七名评委池的 Arena100K 中,标量/可靠性聚合在 20 个真实数据集(按点估计的预算单元格中的 16 个)中的 MSE 低于无限制的联合表校准,而配对 95% 间隔排除了 11 个单元格中的零;更丰富的退避/收缩表缩小了一些差距,同时保留了有限支持瓶颈。受控校准增长数据显示相反的情况:当标签包含六向相互作用时,所选表会增长到具有相互作用的前缀,并且一旦看不见的质量消失,其 MSE 就会从 0.224 下降到 0.061。实际部署问题是下一个法官的信息在可用的人类标签下是否可估计。