论文
当校准取决于评分规则时:量化生物医学 LLM 分类
When Calibration Depends on the Scoring Rule: Quantized Biomedical LLM Classification
摘要
量化的 大语言模型 可以在消费类硬件上运行,这激发了人们对敏感数据的本地处理的兴趣。他们的置信估计的可靠性取决于很少被视为实验变量的实施选择(提示模板、标签措辞和评分标准化)。我们在 FP16、INT8 和 INT4 上对医学摘要中的五类句子分类评估了三个 70 亿参数的 Mistral 变体(基本模型 BioMistral 和在没有聊天模板的情况下评估的指令调整检查点)。我们在 n = 2,000 个测试句子上测试两个主要模板,在 n = 200 个验证句子上测试两个辅助模板。我们在没有事后校准的情况下进行的中心观察是,从求和到平均标记对数似然的切换会逆转哪个模型看起来校准得更好:BioMistral 在匹配条件下的平均校准误差几乎增加了三倍,而指令调整模型的平均校准误差下降了一半以上。这两个检查点的准确度最多变化 1.4 个百分点。负对数似然和 Brier 分数显示出相同的逆转。两个主要模板是使用测试派生示例选择的,因此它们的绝对性能是探索性的。其中,即时选择变化意味着精确度的准确度提高 2.9 至 17.8 个百分点。对于适应的检查点,八位量化的精度最多改变 1.1 个百分点;四位量化显示出混合但非灾难性的影响。事后温度缩放减少了总评分下的校准误差,但在平均标记评分下不适合,因此逆转是否能在每个评分者校准中幸存下来是未知的。这些探索性结果表明,基于解码器的分类器的校准比较应将评分归一化和提示设计视为一阶实验决策。