论文

分解、比较和决策:多模态 LLM 是隐式少样本学习器

Decompose, Compare, and Decide: Multimodal LLMs are Implicit Few-Shot Learners

模型推理推理策略与问题分解

摘要

多模态 大语言模型 (MLLM) 在分析图像时表现出了卓越的能力,但将这些功能转化为少样本图像分类仍然具有挑战性。为了弥补这一差距,我们提出了 DeCoDe,这是一种简单而有效的技术,使现成的 MLLM 能够充当强大的小样本分类器,而无需任何额外的训练。我们的方法建立在少样本分类的思想之上,作为一组成对图像比较,将任务分解为一组二元决策。给定候选类别的查询图像和支持图像,MLLM 会被提示确定这两个图像是否描绘同一类别。然后,对应于肯定响应的 logits 被用作相似性得分,以将查询图像分配给最可能的类别。虽然这已经产生了良好的结果,但我们表明,向模型提供额外的高级信息(例如数据域)可以进一步提高性能。我们的评估提供了对十二个数据集的各种推理变体的广泛分析,其中六个已建立的和六个新策划的跨越不同领域的小样本基准。结果表明,所提出的简单分解技术可以将现成的 MLLM 转变为强大的少样本学习器,在标准和新颖领域都显着优于当前最先进的少样本方法。代码可在 https://github.com/yunhanwang1105/DeCoDe 获取。