论文
WADE:采用紧凑视觉语言模型的多实例漂浮废物目标定位的推理注释基准
WADE: A Reasoning-Annotated Benchmark for Multi-Instance Floating-Waste Grounding with Compact Vision-Language Models
摘要
内陆水道中的漂浮废物威胁着水生生态系统,需要在杂乱、多目标的条件下进行及时监测。现有的水生废物数据集提供的地理覆盖范围有限、多实例注释稀疏,并且除了框和标签之外几乎没有监督。因此,紧凑视觉语言模型(VLM)对于联合定位、分类、计数和解释漂浮废物的评估仍然不够。我们引入了 WADE,这是一个推理注释基准,包含来自孟加拉国农村的 2,167 张图像、13,608 个边界框和 10 个废物类别。每个注释都与涵盖视觉线索、可能的混淆和区分特征的类级识别规则相关联。我们使用检测、计数和幻觉指标在零样本、双样本、推理引导和微调设置下评估了 6 个 VLM。为了实现资源高效的适应,我们使用 QLoRA 在框、标签和推理链上联合微调 Qwen3-VL-2B。 微调 将召回率从 0.0248 增加到 0.2339,将 F1 从 0.0257 增加到 0.2163,同时将图像级幻觉从 0.6836 减少到 0.0883。然而,超过四分之三的实例仍未被发现,这使得 WADE 成为采用紧凑型 VLM 进行密集漂浮废物目标定位的具有挑战性的基准。