论文

无人工标注的 X 射线安检对象定位

Localize Any Object in X-Ray Security Scans without Human Annotation

模型训练合成数据

摘要

X 射线安全检查中的通用对象定位对于安全关键场所的自动威胁检测至关重要。然而,与主导网络规模视觉数据的日常 RGB 图像不同,X 射线扫描表现出独特的颜色图案、模糊的边界以及由体积叠加引起的组合结构。这些差距阻碍了在网络规模 RGB 数据上训练的密集感知基础模型的直接零样本传输。此外,带标注的 X 射线数据稀缺,需要专家标记,这限制了可推广的 X 射线本机模型的训练以及通过微调对 X 射线数据的 RGB 基础模型的适应。考虑到这些挑战,通过 RGB 域中的数据缩放定律实现的高度通用的感知模型的光明前景对于 X 射线检查来说仍然遥不可及。为此,我们引入了 LAO-X,这是一种自我监督的适应框架,它使用具有粒度感知监督的不同合成图像注释对来定位 X 射线扫描中的任何对象。 LAO-X 首先设计一个显着性引导的 X 射线对象挖掘模块来分离不同的对象实例,然后将其用于吸光度域中的物理引导合成。 LAO-X 进一步将遮挡控制课程策略融入到分段任意模型 2 (SAM2) 定位器微调中,随着对象数量和重叠级别的增加,逐步使其适应 X 射线扫描。六个 X 射线基准测试的实验表明,LAO-X 显着改善了与类别无关的定位,在严重混乱的场景中,与 SAM2 和 X 射线特定基线相比,mAP 提高了 2% 到 23%,并且完全没有人工标注的标签。

无人工标注的 X 射线安检对象定位:论文原图
图 2:LAO-X 概述。进行未标记的 X 射线扫描,我们首先提取前景对象以构建项目库。然后使用随机采样的对象合成和注释图像,以模拟真实的 X 射线重叠。最后,我们使用遮挡课程来训练模型,从而无需手动标记即可对 X 射线图像进行多粒度定位。