论文
扩散物体,保留其标签:通过 VLM 构建的 3D 植被场景从一些未标记的照片中整理探测器训练数据
Diffuse the object, keep its label: curating detector training data from a few unlabeled photographs via VLM-built 3D vegetation scenes
摘要
隐藏在植被中的小物体的标记图像很少,并且针对它们进行训练的探测器在不同地点的泛化能力很差。我们不是重复使用在另一个站点收集的标签,而是从部署站点本身的一些未标记的照片中合成标记的训练图像。视觉语言模型从一张照片生成粗略的 3D 植被场景;将 3D 对象网格放置在场景中会直接从场景几何体中生成边界框、分割蒙版和每个实例的遮挡,无需手动注释。在照片上微调的轻量级适配器调节了重新纹理渲染的扩散通道,并且分级掩模锁设置了可以接触对象本身的扩散程度。在我们的运行中,这个等级是最有影响力的管理选择:轻微扩散对象可以提高少数类的召回率,而不是完全保护其像素,而不受限制的扩散则可以消除它。在这些图像上进行训练后,标准探测器达到或超过了在来自不同地点的更大标记的真实图像数据集上训练的对应探测器,在人道主义排雷基准上一致地跨越种子;因此,这种比较是在无监督的情况下对少量照片进行的网站改编与传统的跨网站标签重用的比较。在我们的消融中,增益很大程度上对照片和裁剪预算不敏感,并且域内准确性不能预测跨站点性能。