论文

通过预测驱动的推理进行统计可靠的基于 LLM 的排名评估

Statistically Reliable LLM-Based Ranking Evaluation via Prediction-Powered Inference

模型评测评测方法与指标

摘要

通过 PRECISE,我们扩展了预测驱动推理,通过将小型人工标记集与大型 LLM 判断集相结合,生成排名评估指标的偏差校正估计。无论 LLM 判断的错误概况如何,PPI 都被证明是无偏的。我们通过将输出空间计算从 O(2^|C|) 减少到 O(2^K),使其适用于像 Precision@K 这样的分层指标,其中注释是针对每个文档的,但指标是针对每个查询的。在 ESCI 基准上,使用 Claude 3 Sonnet 判断增强 30 个人类注释,将 Precision@4 估计的标准误差从 4.45 降低到 3.50(相对降低 21%)。在生产系统中,我们的框架从 100 个人工标签和 2 小时的领域专家注释中正确识别了三个系统变体中最好的一个; A/B 测试证实了这一排名,日销售额增加了 407 个基点。