论文
使用预训练的视觉语言模型尊重事后分布外检测中的模态差距
Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models
摘要
分布外 (OOD) 检测已成为一种流行技术,通过识别来自未知类的意外输入来增强机器学习模型的可靠性。预训练视觉语言模型 (VLM) 的最新进展实现了零样本 OOD 检测,无需访问分布内 (ID) 训练数据;在这种情况下,现有方法通常将类名称的文本嵌入视为类原型。在本文中,我们从理论上证明现成的文本原型通常与最佳视觉原型不一致,从而产生无法仅通过即时工程消除的内在模态差距,从而挑战了广泛采用的文本作为原型范式。为了缩小事后约束下的这一差距,本文提出了一种在线伪监督框架,该框架使用未标记的测试时数据流和来自预训练 VLM 的软预测来直接学习视觉特征空间中的类原型。我们为在线优化过程的收敛提供了理论保证。大量实验凭经验证明我们的方法在各种 OOD 检测设置中实现了最新的技术水平。