论文

通过候选验证和散度移位进行高效的测试时适应

Efficient Test-time Adaptation through Candidate Verification and Divergence Shifts

模型推理推理验证与自校正

摘要

视觉语言模型(VLM)实现了强大的零样本可迁移性,但在推理时仍然容易受到目标域变化的影响。 测试时自适应(TTA)提供了一种实用的补救措施,但大多数现有的VLM-TTA 方法都遵循预测端自适应范例。他们使用测试样本来调整逻辑、原型、缓存、先验或特征统计数据,通常会产生额外的计算开销。在本文中,我们采取不同的视角,将VLM-TTA 重新构建为候选验证,而不是预测调整。我们提出了测试时 Correction (TTC),这是一个基于假设的校正框架,遵循一个简单的原则:假设、重建、纠正。给定一个测试特征及其前 k 个候选标签,TTC 将每个候选标签视为假设,在存储在记忆库中的相应潜在子空间内重建特征,并测量所得的散度偏移。这种转变量化了在假设插入测试特征后候选子空间及其与其他候选者的关系发生了多少变化。正确的候选假设只会引起很小的变化,而错误的假设则会更强烈地扰动子空间。因此,TTC 通过选择具有最小聚合散度偏移的候选来纠正预测。这种无需训练候选-验证机制避免了迭代优化,并提供了有利的精度-效率权衡。在 5 个 TTA 设置和 15 个基准数据集(包括零样本分类、领域泛化、少样本分类、从基础到新的泛化和跨数据集评估)中,TTC 始终比最先进的VLM-TTA 方法提高了准确性,同时实现了比现有方法高达 2 倍的加速、CPU 记忆使用率降低 3 倍以上、GPU 记忆使用率降低高达 1.4 倍。最低-记忆无需训练基线。