论文
VIP:视觉引导快速进化,实现高效密集视觉语言推理
VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference
摘要
由于 CLIP 中根深蒂固的空间偏差,以有效且可推广的方式追求 无需训练 开放词汇语义分割仍然具有挑战性。为了克服现有解决方案的局限性,这项工作超越了基于 CLIP 的范式,并利用最近的空间感知 dino$.$txt 框架来促进更高效和高质量的密集预测。虽然 dino$.$txt 表现出强大的空间意识,但我们发现文本查询的语义模糊性导致其密集的跨模式交互中出现严重的不匹配。为了解决这个问题,我们引入视觉引导提示进化(VIP)来纠正 dino$.$txt 中文本查询的语义表达,释放其细粒度对象感知的潜力。为此,VIP 将别名扩展与视觉引导的 蒸馏 机制集成在一起,以挖掘有价值的语义线索,这些线索以显着性感知的方式稳健聚合,以产生高保真度预测。广泛的评估表明,VIP:1. 平均 mIoU 超过顶尖方法 1.4%-8.4%,2. 可以很好地推广到各种具有挑战性的领域,3. 需要边际推理时间和内存开销。