论文

零样本二元视觉语言安全分类中的提示引起的分数方差

Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification

模型评测鲁棒性、公平性与可信度评测

摘要

来自零样本视觉语言模型(VLM)安全分类器的单提示第一个标记概率被视为决策分数,但我们表明它们在语义等效的提示重新表述下是不可靠的:即使当二进制标签被限制在固定的输出位置时,等效的提示也可能对同一样本产生实质上不同的不安全概率。在多模式安全基准和多个 VLM 系列中,交叉提示方差与提示级别的不一致和较高的错误密切相关,使其成为有用的脆弱性诊断。相对于训练选择的单提示基线,无需训练 平均集成改进了所有 14 个数据集模型评估对的 NLL 和 12/14 的 ECE,并且比应用于相同提示的标记温度缩放、普拉特缩放和等渗回归赢得了更多的头对头 NLL 比较。排名增益与 AUROC 和 AUPRC 上训练选择的基线一致,并且与完整的 15 个提示分布在 AUPRC 上保持一致,而在 AUROC 上有所软化。当标签可用时,平均值之上的标记校准可提供进一步的增益,将提示平均识别为强大的无标记第一阶段,而不是校准的替代品。我们将此视为零样本 VLM 第一个词元安全评分的可靠性压力测试,并建议使用均值聚合作为标准的无标签可靠性基线进行即时系列评估。