论文

VLM 中少样本分布外自适应的归纳视觉逻辑

Inductive Visual Logic for Few-Shot Out-Of-Distribution Adaptation in VLMs

模型推理推理策略与问题分解

摘要

Qwen-VL 和 LLaVA 等生成视觉语言模型 (VLM) 在与其预训练分布重叠的任务上实现了强大的零样本性能,但在从未学习过所需判别性特征的专业领域上却失败了,我们将这种情况称为远程分布外 (OOD)。标准自适应方法无法克服这种代表性缺失,因为它们在编码器的现有特征空间内运行。然而,即使歧视崩溃,VLM 仍保留强大的描述能力:无法对医学扫描进行分类的模型仍然可以阐明其视觉模式。利用这种不对称性,我们引入了归纳视觉逻辑(IVL),这是一种无需训练的框架,可以根据模型幸存的描述能力构建分类知识。 IVL通过双模式提示从少镜头支持图像中提取视觉特征,将语义描述与原始视觉观察相结合,并将其组织成每类特征字典。在推理时,分层过滤识别基于空间的特征证据以进行分类。在多个远程 OOD 基准中,IVL 在两个 VLM 主干下实现了最高的聚合准确度,同时生成可解释、可追踪的预测。