论文

使用多个 LLM 法官对预算进行实例最优估计

Instance-Optimal Estimation with Multiple LLM Judges on a Budget

模型评测评测方法与指标

摘要

评估 大语言模型 越来越依赖于 LLM 作为法官协议,但这种评估仍然成本高昂:不同的法官有不同的价格和可靠性,并且每个即时响应对的难度可能有很大差异。这就提出了一个基本的分配问题:在固定预算下,应该如何在异构法官和实例之间分配评估查询以获得最准确的分数估计?我们将这个问题形式化为“预算异方差多法官估计”。给定 $K$ 提示-响应对、$J$ 以已知成本和未知查询-判断方差进行判断,目标是估计有界分数向量,同时最小化 $\ell_p$ 错误。我们的第一个贡献是分析逆方差加权估计器(IVWE)并推导出可最小化其错误率的预言机分配。由于这种分配取决于未知方差,因此我们通过提出 EST-IVWE 来解决实际的未知方差设置,EST-IVWE 是一种自适应算法,可构建并利用“乐观偏差”方差估计来稳定经验分配。我们证明 EST-IVWE 将预言机 IVWE 率与预算中的低阶项相匹配。我们的第二个也是核心的理论贡献是匹配的*局部*最小最大下界,它建立了所提出算法的实例最优性。一个关键的技术见解是 Fano 型高概率论证对于这个问题来说过于粗糙:它们的打包结构失去了控制最优分配的局部方差结构。相反,我们使用基于局部扰动的 Assouad 型预期论证,它保留了这种结构并产生了尖锐的分配相关下限。最后,我们在合成数据集和 HelpSteer2 数据集上以数值方式验证了我们的方法相对于简单统一分配的优越性。