论文
单一提示准确性缺失的地方:语言模型的多变体可靠性审核
What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models
摘要
单提示准确性是对语言模型进行基准测试的主要方法,但它可能会错过重要的可靠性故障。我们评估了 15 个模型开放权重语料库,主要可靠性分析集中在五个分类和推理基准的 10 个指导模型上,每个模型有五个提示变体,测量准确性、标记概率校准、言语置信度校准、言语解析率和每个(模型 x 数据集 x 变体)单元格的提示扰动分布。我们发现了三个广泛的结果。首先,评估设计可以实质性地改变结论。将预期校准误差 (ECE) 标记从原始定义切换为标签集标准化定义,每个单元的校准变化平均绝对值 0.149。更引人注目的是,在 ARC-Challenge 上将思维链提示与第一个字符评估器配对后,所有五个主要模型的表观准确度降低了 72-88%;两个独立的修复程序分别恢复了 93.8% 和 102.7% 的性能损失,表明评估器端而不是模型端出现故障。其次,信心信号脆弱。在 MMLU-Pro 上,每个主要模型口头报告的置信度大大高于其在同一行上的准确性和标记概率置信度,并且单个提示变体上的单个模型的口头解析率可能会崩溃。第三,提示稳健性不能可靠地跟踪参数计数。在 10 个指令模型中,模型大小和即时扰动分布之间的相关性在基准范围内从 -0.244 到 0.474 不等。总而言之,这些结果表明,小型语言模型的可靠性结论不仅取决于所评估的模型,还取决于用于衡量模型的评估流程。我们认为,在做出可靠性声明时,应明确报告校准定义、评估器逻辑、语言可解析性和提示稳健性。