论文
对基准进行基准测试:测试常识基准的预测有效性
Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks
摘要
预测 LLM 在实际任务中的能力至关重要,但常识基准测试的性能对下游性能的预测程度仍不清楚。为了建立广泛采用的常识基准的实际可用性,我们根据四个已建立的常识基准、四个修改后的变体、三个非常识控制以及需要隐式社会、实用、时间或物理推理的八个下游任务来评估来自六个系列的 23 个模型。我们比较模型排名,计算受控相关性,并使用留一族交叉验证来评估常识基准的标准有效性。我们的结果表明,修订后的基准在很大程度上保留了原始模型排名,并且没有提高下游预测能力。常识基准仅对下游任务的一小部分显示出一致的跨家庭预测有效性,而在其他地方则具有较小或特定指标的收益。总体而言,标准化常识基准提供了下游常识能力的依赖于任务的证据,而不是广泛的证据。