论文

如何对大语言模型评审进行统计并信任结果:使用 evalstats 进行小样本人工智能评估的校准推理

How to Run Statistics over LLM Judges and Trust the Results: Calibrated Inference for Small-Sample AI Evaluation with evalstats

模型评测评测方法与指标

摘要

学术界的研究人员越来越多地将重要性主张建立在大语言模型评审分数和小样本人工智能评估的基础上。然而,如果没有经过良好校准的置信区间(CI)、假设检验和判断偏差修正,这样的说法是不可靠的。我们在几个贡献中解决了这些问题。首先,我们发现对原始大语言模型评审分数进行统计会导致误报夸大:与直觉相反,对于许多评估者间一致性指标来说,误报风险在“几乎完美”的人类与大语言模型一致性处达到峰值。为了帮助研究人员了解如何负责任地对大语言模型评审进行统计,我们提供了用于混合人类人工智能评审设计的统计分析的指南和工具,并通过预测动力推理(PPI)实施九个假设检验,包括对四个基于等级的测试(Wilcoxon 符号等级、Mann-Whitney U 和综合变体)的第一个已知的 PPI 校正。为了通过小型人工标记校准集保持 PPI++ 稳定,我们引入了引导自适应功率调整,它将估计权重缩小到根据标记数据估计的目标,并考虑该权重自身的采样方差。其次,通过蒙特卡罗模拟,我们得出了用于小样本 AI 评估 (N<100) 的 CI、p 值和 FWER 校正方法的建议,并警告研究人员不要使用引导 CI。我们将这些建议打包到 evalstats 中,这是一个自动选择校准方法的开源 Python 包,并在三种场景中进行演示,其中包括一个真正的 LLM 评审在“实质性一致”下验证的情况,会导致研究人员发布虚假的发现。 evalstats 可在 https://github.com/ianarawjo/evalstats. 上公开获取