论文

RADC:风险感知的视觉语言测试时双缓存适配

RADC: Risk-Aware Dual Caching for Vision-Language Test-Time Adaptation

模型推理解码与生成控制

摘要

用于视觉语言模型的基于缓存的测试时自适应 (TTA) 通常受到全局表示中的背景偏差和表示变化下不可靠的基于熵的缓存准入的阻碍。为了解决这些限制,我们提出了 RADC,它通过可靠的双缓存来增强原型学习。 RADC 引入了语义前景缓存,该缓存从 CLIP 表示中聚合类别一致的空间证据,生成补充全局缓存的前景原型,同时减轻背景干扰。为了可靠地管理两个缓存,高斯风险准入将多视图表示建模为对角高斯分布,并共同考虑类分离和特征不确定性,以优先考虑可靠的缓存候选者。 RADC 将零样本 logits 与互补的全局和前台缓存预测集成在一起,以实现稳健的推理。对跨域和分布外基准的广泛实验证明了一致的最先进的性能。

RADC:风险感知的视觉语言测试时双缓存适配:论文原图
图 1:RADC 概述。 (a) RADC 通过 SFC 补充全局缓存,并结合零样本、全局和前台逻辑进行预测。 (b) SFC 从空间 CLIP 特征中定位类别一致区域以构建前景查询。 (c) GRA 评估类分离和特征不确定性以管理全局和前台缓存。