论文

量化 LLM 基准中的排名不确定性

Quantifying Ranking Uncertainty in LLM Benchmarks

模型评测评测方法与指标

摘要

预训练模型通常会在多任务排行榜上排名,以评估其在不同任务中的有效性。最近引入了排名置信区间作为一种通过聚合成对假设检验来量化这些排名的不确定性的方法。在这项工作中,我们分析了知识评估基准 MMLU 中的不确定性来源,并展示了如何修改假设检验以解释其影响。我们证明,MMLU 受试者之间的排名变异性很大,在比较 LLM 或识别表现最好的模型时应考虑到这一点。