论文
BindCLIP:组合视觉语言评分的一种平衡耦合
BindCLIP: One Balanced Coupling For Compositional Vision Language Scoring
摘要
全局视觉——语言相似性将图像和标题压缩为一个向量,保留语义,但不保留哪个单词对应哪个区域或这些区域如何排列;模型可以识别每个单词和物体,但更喜欢成分不正确的标题。我们认为冻结的编码器保留了这种关联结构,因此问题是读取它而不是在预训练的相似性旁边重建它。我们引入了 BindCLIP,这是一种建立在一个潜在对象上的成对评分器:一种平衡的标记-补丁-深度最优传输耦合,将候选标题和多个视觉深度放在一个计划中。语义、实体、顺序和空间证据被解读为该状态的能量,交换候选者会排列计划,使分数完全反对称。耦合契约内部的几何细化移动是候选者和视觉深度不支持的。不使用任务标签、解析器、关系清单或检测器。一个检查点和一个推理路径相对于冻结的全球 CLIP 改进了官方 What'sUp、ARO 和 SugarCrepe 基准,在关系分裂上具有最强的转移。控制排除了补丁访问和标题长度快捷方式,并且推理时间损伤将空间排列定位到耦合。