论文

LLM 判决的本地化然后决定保证

Localize-Then-Decide Guarantees for LLM Judgments

模型评测评测方法与指标

摘要

大语言模型 (LLM) 越来越多地用作评估器来评估输出质量和偏好一致性,但提供与人类判断一致的可靠保证仍然具有挑战性。最近的工作引入了置信阈值方法,该方法为成对比较提供了这样的保证,其假设是较高的估计置信度意味着与人类的分歧风险较低。然而,当候选响应数量增加时,这种假设可能会被打破,因为将概率质量分布在许多替代方案中可能会扭曲置信估计。为了解决这个问题,我们提出了一个 Localize-Then-Decide 框架。首先,保形预测定位了一个小候选列表,其中包含高概率的人类首选响应。然后,经过校准的基于置信度的规则有选择地从此候选列表中选择单个响应或弃权。这种设计恢复了置信度和分歧风险之间的单调关系,并实现了高概率的一致保证。在多个数据集上对多个候选大小进行实验并判断 LLM 表明,我们的框架始终比单阶段基线实现更高的保证成功率和更高的覆盖率。