论文
G2D:零样本图像分类的生成到判别协作推理
G2D: Generative-to-Discriminative Collaborative Inference for Zero-Shot Image Classification
摘要
零样本分类需要高效的标签检索和细粒度的视觉推理,但判别性和生成视觉语言模型以互补的方式失败。当 CLIP 的 top-1 预测错误时,正确的标签通常保留在其 top-$K$ 候选列表中,从而消除歧义而不是回忆关键挑战。然而,独立的生成模型受到大标签空间和不受约束的输出的阻碍。这种互补性促使将广泛的候选检索与细粒度的候选检索分开,基于图像的验证。我们提出 G2D,一种 无需训练 框架,它使用生成 VLM 来根据图像验证 CLIP 检索的候选者。候选者名称和 CLIP 概率为解析视觉上相似的类提供结构化先验。固定置信度路由、熵自适应候选者大小调整和 trie 约束解码将生成推理集中在不确定样本上,并确保测试时每个输入有一个有效输出。跨越 8 个在基准测试中,G2D 的平均准确度为 68.85%,而 CLIP 为 59.35%,独立 VLM 为 63.11%。在七种生成器配置中,候选集验证将平均准确度提高了 1.08--27.42 个百分点。G2D 还转移到 DCLIP、WaffleCLIP 和 CuPL,支持判别性提案和生成视觉推理之间的实用接口。代码:https://github.com/Harzva/G2D