论文

GATE:用于 无需训练 视觉语言模型测试时适应的可靠性门控高斯证据融合

GATE: Reliability-Gated Gaussian Evidence Fusion for Training-Free Test-Time Adaptation of Vision-Language Models

模型推理推理验证与自校正

摘要

CLIP 和 SigLIP 等视觉语言模型提供了强大的零样本识别,但当部署在与预训练分布不同的目标数据上时,它们的预测可能会降低。测试时适应提供了一种在没有源数据或目标标签的情况下提高稳健性的实用方法,但现有方法通常仅依赖于提示侧适应或图像侧目标证据。在这项工作中,我们介绍了 GATE,一种 无需训练 两遍传导测试时间自适应框架,它使用未标记的目标集,同时保持图像编码器、文本编码器和提示参数完全冻结。 GATE 不是用单个原型来表示每个类,而是在共享视觉语言特征空间中构建两个互补的高斯证据源:根据多种语言描述估计的文本高斯和根据可靠的未标记目标样本估计的图像高斯。类别可靠性门控制图像衍生伪证据的影响,分数级广义专家产品融合产生对原始零样本 logits 的归一化残差校正。在细粒度识别数据集、ImageNet 系列分布变化、多个 CLIP 主干和 SigLIP-B/16 中,GATE 在每个基准/主干组中实现了最佳平均准确度。它平均将零样本性能提高了 5.41 点,比最强的非 GATE 基线高 1.94 点,证明了可靠性门控分布证据对于冻结 VLM 适应的好处。