论文
DetPO:使用多模态 LLM 进行上下文学习,用于少样本目标检测
DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection
摘要
多模态 LLM (MLLM) 在 OdinW-13 和 RefCOCO 等流行的目标检测基准上展示了强大的视觉基础能力。然而,最先进的模型仍然难以推广到 预训练 中通常不存在的分布外类别、任务和成像模式。虽然上下文提示是提高不同任务性能的常见策略,但我们发现它的检测精度通常比单独使用类名提示要低。这表明当前的 MLLM 尚无法有效地利用少量视觉示例和丰富的文本描述来进行对象检测。由于前沿 MLLM 通常只能通过 API 访问,而且最先进的开放权重模型在消费级硬件上进行微调的成本高昂,因此我们转而探索针对少样本目标检测的黑盒提示优化。为此,我们提出了检测提示优化(DetPO),这是一种无梯度测试时优化方法,通过在校准预测置信度的同时最大限度地提高少数视觉训练示例的检测精度来细化纯文本提示。我们提出的方法在 Roboflow20-VL 和 LVIS 上的通用 MLLM 上产生了一致的改进,比之前的黑盒方法高出高达 9.7 mAP。我们的代码和优化提示可在 https://gare-cmu.github.io/DetPO/ 获取