论文

稀疏交叉标注如何影响LLM评审的部署判断

LLM Judge Validation Under Sparse Overlap: From Inference to Design

模型评测评测方法与指标

摘要

验证LLM评审需要估计它与人类的一致程度,但标注预算通常不允许对每个样本进行多人标注。我们证明,标注重叠的稀疏程度是错误部署决策的首要决定因素:两两标注重叠率为5%时,错误决策率可达25%,从十个候选中选错最佳评审的概率为65%。两个可操作的杠杆是重叠数量和分配方式。对于数量,我们推导最低重叠公式,说明对于非临界评审,ρ≥0.25已经足够,而临界情形在本质上仍然困难。对于分配,当分层信息有效时,零额外成本的分层方案相对于随机抽样可将错误拒绝率减半。我们在十种LLM评审和四个评测矩阵上验证方法,覆盖视觉评估、因果推理和摘要任务。