论文

WALDO:杂乱场景中的一次性样本条件目标检测

WALDO: One-Shot Exemplar-Conditioned Object Detection in Cluttered Scenes

模型优化小模型/轻量模型

摘要

使用单个参考图像和简短描述在杂乱的场景中定位特定的对象实例,并在该实例不存在时进行报告,大型视觉语言模型通常可以解决此任务。我们询问,通过世界模型预训练目标已经学习到的表示,是否可以更便宜地获得相同的功能。我们提出了 WALDO,一种一次性样本和语言条件检测头,具有 3.4M 可训练参数,可读取冻结的 V-JEPA 2.1 特征,以联合预测对象定位和目标存在,并且主干上没有梯度。由于样本条件监督很少,因此我们从实例注释中合成训练集,从 真值 框中挖掘样本,并构建排除引用实例的缺席案例,同时保留相同类别的干扰项。这很容易出错:在明显的实现中,仅靠裁剪大小来预测标签,并且对其进行训练的头部在没有咨询示例的情况下就达到了 0.9998 缺失 AUROC,并且我们报告了关闭捷径的负控制。在 35 个保留的杂乱场景中,WALDO 获得了 0.461 的目录 AP@50,而在相同记分器下提示的 Grounding DINO 基线为 0.306。在匹配的 576 个词元网格下用 DINOv3 替换 V-JEPA,类别内缺失 AUROC 从 0.880 下降到 0.726,实例 AP@50 从 0.201 下降到 0.141,将预训练目标而不是输入分辨率作为增益来源。然而,实例级 Success@1 仅达到 0.190,而类别机会下限为 0.190:世界模型特征转移到定位精度和缺失检测,但没有转移到实例身份。