论文
TTL:使用预训练视觉语言模型进行 OOD 检测的测试时文本学习
TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models
摘要
CLIP 等视觉语言模型 (VLM) 通过对齐视觉和文本表示,展现出强大的分布外 (OOD) 检测功能。最近基于 CLIP 的测试时间适应方法通过合并外部 OOD 标签进一步提高了检测性能。然而,这样的标签是有限且固定的,而真正的 OOD 语义空间本质上是开放的。因此,固定标签无法表示测试流中遇到的多样化且不断发展的 OOD 语义。为了解决这个限制,我们引入了测试时文本学习(TTL),这是一个从未标记的测试流中动态学习 OOD 文本语义的框架,而不依赖于外部 OOD 标签。 TTL 使用伪标记测试样本更新可学习的提示,以捕获新兴的 OOD 知识。为了抑制伪标签引入的噪声,我们引入了 OOD 知识纯化策略,该策略选择可靠的 OOD 样本进行适应,同时抑制噪声。此外,TTL还维护着OOD文本知识库,存储高质量的文本特征,提供跨批次的稳定分数校准。对两个标准基准测试和九个 OOD 数据集进行的广泛实验表明,TTL 始终如一地实现了最先进的性能,突出了文本适应对于稳健的测试时 OOD 检测的价值。我们的代码可在 https://github.com/figec/TTL 获取。