论文
ProtoLIP:从句子级到对象级证据解缠
ProtoLIP: From Sentence-Level to Object-Level Evidence Disentanglement
摘要
查询条件视觉语言模型通过揭示视觉证据如何随文本查询而变化,从而实现细粒度的解释。然而,以完整描述为条件的证据不一定分解为特定于对象的证据,暴露的证据图也不一定识别构成模型预测的证据。在多个 VLM 架构和独立基准测试中,我们发现对象级查询通常保留来自同时出现的对象和共享上下文的证据。在本文中,我们介绍了 \textbf{ProtoLIP},这是一个轻量级的原型介导的证据层,它将可重用的视觉原型组织成文本派生的语义族,并使用依赖于查询的族路由来限制哪些原型可以提供证据。无需空间注释或主干再训练,ProtoLIP 改进了跨查询粒度的证据定位和分离,并将定位增益转移到具有良好对齐的补丁文本表示的独立预训练 VLM。尽管仅使用文本衍生的弱监督,ProtoLIP 仍然与空间监督基础模型竞争,同时保持强匹配和有竞争力的图像文本检索。至关重要的是,ProtoLIP 直接根据本地化原型证据构建其匹配分数,使分数能够准确分解为语义族和原型贡献。