论文

通过快速调节和磁头选择解锁 LVLM 中的少样本功能

Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection

模型评测模型行为与机制分析

摘要

当前的大视觉语言模型 (LVLM) 擅长许多零样本任务,例如图像字幕、视觉问答和 OCR。然而,这些相同的模型在图像分类任务中表现不佳,与基于 CLIP 的方法相比表现不佳。值得注意的是,这种差距令人惊讶,因为许多 LVLM 使用 CLIP 预训练的视觉编码器。然而,LVLM 本质上不受具有独立视觉和文本编码器的 CLIP 架构的限制。在 CLIP 中,这种分离使分类偏向于类名匹配,而不是联合视觉文本推理。在本文中,我们表明,尽管 LVLM 的原始性能较差,但它可以使用即时调节来提高推理时的视觉特征类可分离性,并且 LVLM 的内部表示(尤其是注意力头)可以在零样本和少样本分类中优于模型本身。我们引入 Head Ensemble Classifiers (HEC) 来弥补基于 CLIP 和基于 LVLM 的分类方法之间的性能差距。受高斯判别分析的启发,HEC 对最具判别力的视觉和文本头进行排名,并将它们组合成 无需训练 分类器。我们证明 HEC 在 12 个数据集的少样本和零样本分类中实现了最先进的性能。