论文
超越平均值:用于 LLM 评估的模型内可靠变化检测
Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation
摘要
我们将可靠变化指数(RCI;Jacobson 和 Truax,1991)从临床心理学改编为项目级 LLM 版本比较,对 2,000 个 MMLU-Pro 项目(K=10 个样本,T=0.7)进行比较。测试了两对家庭内的配对:Llama 3 至 3.1(+1.6 分)和 Qwen 2.5 至 3(+2.8 分)。在完整的基准测试中,大多数项目没有显示出可靠的变化(79% 和 72%)。然而,超过一半的物品是地板/天花板。在可分析项目中,变化是双向的,影响大小较大:Llama 改善了 34%,恶化了 28%; Qwen 的情况改善了 47%,恶化了 39%(中位数 |delta p| = 0.50 和 0.90)。流失率在难度上是不对称的:低准确度的项目得到改善,高准确度的项目恶化。领域级分解揭示了特定家族的逆转:Llama 失去了物理学,而 Qwen 失去了法律。贪婪的单次评估错过了 42% 的可靠更改项目,并错误地标记了 25% 的未更改项目。总准确度增益是相反的项目级移动的净残差。我们建议报告流失率以及总体准确性。