论文

以正例—未标注学习审计LLM评判

Quantifying and Auditing LLM Evaluation via Positive--Unlabeled Learning

模型评测评测方法与指标

摘要

大语言模型 (LLM) 越来越多地用作可扩展评估的裁判,但此类 LLM 作为裁判系统表现出与语义质量脱钩的系统偏差,最明显的是冗长偏差。与此同时,人类监督成本高昂,而且通常是选择性的,会产生可靠的积极判断,但大多数产出都没有标签,质量可能参差不齐。我们将选择性人类监督下的 LLM 评估制定为正样本—未标注学习问题,并提出基于部分最优传输的几何审核框架。通过将一小组经人类验证的正样本与固定嵌入空间中未标记输出的可靠子集进行对齐,我们的方法可以识别人类一致的偏好,并纠正有偏见的判断,而无需重新训练。实验证明,它与人类偏好的一致性得到了改善,对呈现偏差的稳健性得到了提高,并且可以解释置信度估计,为现有的 LLM 作为裁判管道提供了可扩展且基于统计的替代方案。