论文

尊重零样本不确定性:针对测试时间自适应视觉语言模型的保守校准

Respect Your Zero-Shot Uncertainty: Conservative Calibration for Test-Time-Adapted Vision-Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

测试时间适应(TTA)可以提高视觉语言模型在分布变化下的识别精度,但通常会降低校准效果,使下游决策的预测置信度变得不可靠。许多现有的无标记校准方法要么与即时优化相结合,要么依赖于仅提供预测分布的粗略表征的 logits 范围统计数据。我们证明,即使 top-1 预测及其正确性保持不变,TTA 也可以增加置信度并减少熵,这种故障模式我们称为预测保留锐化。在不同的 TTA 方法和基准中,相对于配对零样本预测更大的熵减少与预期校准误差 (ECE) 的更大增加相关。在熵减少的样本上,置信度增益也往往超过准确度增益。基于这些发现,我们提出了零样本锚定熵校准(ZAEC),这是一种无标签事后方法,使用零样本熵作为样本特定的不确定性参考。 ZAEC 通过最小的温度缩放选择性地恢复锐化预测的零样本熵,同时保持所有其他预测不变。它不需要标记的校准数据或学习的参数,并保留类别排名和分类准确性。在五种 TTA 方法和 15 个数据集上,ZAEC 在 ViT-B/16 上实现了最低的事后宏观平均 ECE,并在 RN50 上获得了一致的增益。