论文

分解LLM-判断不确定性以定位专家标签

Decomposing LLM-Judge Uncertainty to Target Expert Labels

模型评测评测方法与指标

摘要

LLM 法官大规模评估输出。专家应该只在最不确定的地方进行标记。它的自然升级信号融合了两种不确定性:专家库中的任意的、真实的分歧,标签不能减少这些不确定性;认知性的,法官的无知,标签确实可以减少。一个小型贝叶斯模型将它们分开:对已收集的标签进行回归,了解对黑盒法官的预测的信任程度。这两个组件都遵循简单的公式,没有采样或进一步的判断调用。真实 LLM 上的组件隔离根据确切已知的事实进行判断,并且声明的置信度并不能指导其实际错误。对于真实的人类分歧 (ChaosNLI),认知排名比相同专家标签的总不确定性多消除了 83% 的错误,尽管简单地升级标签最少的项目也能起到同样的效果。我们证明我们可以估计法官在哪里无知,而不是在专家真正不同意的地方,并建议使用它来指导专家标签。代码和数据可在 https://github.com/composo-ai/judge-uncertainty-decomposition 获取。