论文

用于测试时提示调整的双模态锚引导过滤

Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning

模型训练参数高效训练

摘要

测试时提示调整(TPT)使用增强视图来调整视觉语言模型,但其有效性因确定哪些视图是有益的挑战而受到阻碍。标准的基于熵的过滤依赖于模型的内部置信度分数,该分数通常在分布变化下被错误校准,为不相关的作物或背景区域分配高置信度,同时忽略语义内容。为了解决这个问题,我们提出了一种双模态锚引导框架,该框架将视图选择基于语义证据。我们引入了来自属性丰富的描述的文本锚点,以提供细粒度的类语义,以及捕获不断变化的测试时间统计数据的自适应图像锚点。使用这些锚点,我们根据对齐和置信度过滤视图,确保只有信息丰富的视图才能指导适应。此外,我们将锚点视为辅助预测头,并将其预测与置信加权集成中的原始输出相结合,产生稳定的监督信号以进行及时更新。对 15 个基准数据集进行的广泛实验展示了新的最先进的性能,强调了锚引导监督作为稳健及时更新的基础的贡献。