论文
判断、检索或弃权:具有可证明风险保证的不确定性保护 LLM 判断
Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees
摘要
使用 LLM 作为评判者已成为大规模评估模型输出的标准做法。这对于主观的、开放式的任务尤其常见,例如评估有用性或一致性,其中不存在单一的参考答案。然而,客观任务给无参考 LLM 判断带来了明显的可靠性挑战。在没有参考答案的情况下,法官通过参数知识或工具增强来评估事实的正确性。尽管前者可以进行有效的评估,但法官可能会产生幻觉或缺乏足够的证据来做出判决。相反,工具增强可以提供额外的证据,但会带来额外的计算成本,并且需要适当的机制来确定何时以及如何可靠地使用该证据。更重要的是,这两种方法都不能单独提供对已接受判决的风险的正式控制,也不能保证其在特定水平上的可靠性。我们提出了一个风险控制框架,使用有限样本 Clopper-Pearson 区间来校准保留集上的不确定性阈值,以便接受的判决中的错误发现率以高概率保持在用户指定的水平 ~$α$ 以下。当参数模式信心不足时,实例将被路由到检索增强模式,其中法官收集网络证据并在第二个校准阈值下重新评估实例。有限样本保证延续到这个二阈值路由,而无需额外的假设。在不同规模的开放域 QA 基准测试和评审中,该框架保持了目标错误率,同时实现了比单模式基准更高的覆盖范围。