论文
OneFocus:通过统一视觉语言模型实现真实世界的 X 射线安全检查
OneFocus: Enabling Real-World X-ray Security Screening with a Unified Vision-Language Model
摘要
X 射线违禁品检测对于大规模物流和运输的安全至关重要,但传统探测器很难适应新兴的违禁品类型,并且缺乏基本的视觉理解。视觉语言模型 (VLM) 具有很强的泛化能力,但由于缺乏高质量的 X 射线图像描述数据而受到阻碍。为了弥补这一关键差距,我们推出了 MMXray,这是一个精心策划的基准,包含 52,124 个图像与描述对,涵盖 28 个细粒度 X 射线违禁品类别。为了丰富 MMXray 的真实遮挡模式,我们进一步引入了 CleanDET,这是一个专用合成数据集,包含来自 28 个类别的干净前景违禁品图像和具有不同密度级别的背景图像,以及 AnyContraSyn,这是一种设计用于在 CleanDET 上运行的可控合成方法。我们还开发了 OnePipe,这是一种用于系统数据管理的可扩展管道。基于 MMXray,我们提出了 OneFocus,这是一种统一的 VLM,支持四个核心任务:视觉问答、违禁品定位、分类和图像理解。 OneFocus 在 X 射线违禁品理解方面实现了最先进的性能,并展示了强大的跨域泛化能力,为安全筛查建立了强大的视觉语言基线。