论文
你的 VFM 会说植物语吗?目标检测视觉基础模型的植物学语法
Does Your VFM Speak Plant? The Botanical Grammar of Vision Foundation Models for Object Detection
摘要
视觉基础模型 (VFM) 有望在无需特定任务训练数据的情况下实现零样本目标检测,但它们在复杂农业场景中的性能仍然对文本提示构造高度敏感。我们提出了一个系统的即时优化框架,评估四个开放词汇检测器(YOLO World、SAM3、Grounding DINO 和 OWLv2),用于跨合成和真实现场图像的豇豆花和豆荚检测。我们将提示分解为八个轴,并进行一次一个因素的分析,然后进行组合优化,揭示模型对提示结构的反应不同:优化一种架构的条件可能会导致另一种架构崩溃。应用特定于模型的组合提示比原始物种名称基线产生了显着的收益,包括在合成豇豆花数据上 YOLO World 的 +0.357 mAP@0.5 和 OWLv2 的 +0.362 mAP@0.5。为了评估跨任务泛化,我们使用 LLM 将发现的轴结构转换为形态上不同的目标(豇豆荚),并与使用从合成花数据中发现的最佳结构进行提示进行比较。至关重要的是,专门针对合成数据有效传输到现实世界字段而优化的提示结构:对于大多数模型-对象组合,合成管道提示匹配或超过在标记的真实数据上发现的提示(花:YOLO World 的 0.374 与 0.353;pod:SAM3 的 0.429 与 0.371)。我们的研究结果表明,提示工程可以显着缩小零样本 VFM 和监督检测器之间的差距,而无需手动注释,并且最佳提示是特定于模型的、不明显的,并且可以跨领域转移。