论文

当校准排名逆转时:LLM 公平比较的精度控制评估

When Calibration Rankings Reverse: Accuracy-Controlled Evaluation for Fair Comparison of LLMs

模型评测评测方法与指标

摘要

校准评估模型置信度是否与其经验准确性相符。现有研究经常使用预期校准误差和 Brier 分数等全局校准指标来比较不同 大语言模型 的校准。我们首先从理论上和经验上表明,这种比较会因模型准确性的差异而混淆。为了更公平的跨模型比较,我们提出了 ACE,这是一种精度控制的评估框架,具有三个互补的视图:实例对齐、分布对齐和候选对齐校准。在多个基准、模型系列和置信度激发方法中,我们使用 ACE 来研究两个实际重要的比较轴:小模型与大模型以及思考模型与非思考模型。我们发现,许多先前报道的原始全局指标下的校准优势在精度控制后大幅减弱。我们还发现,排名逆转很常见:一旦控制了准确性,受原始指标青睐的模型通常就会不再受到青睐。我们的结果表明,原始全局校准指标对于跨模型比较来说并不稳健,并且公平的校准比较需要准确性感知的评估。