论文

RT-DETR-World:向实时开放词汇检测迁移LLM语义

RT-DETR-World: Transferring Rich LLM Semantics to Real-Time Open-Vocabulary Detection

模型优化模型训练应用与实践合成数据蒸馏视觉感知与空间理解

摘要

开放词汇检测(OVD)通过文本类别查询来识别训练期间未见过的类别,但以实时效率实现强泛化仍然具有挑战性。除了词汇量缩放之外,零样本泛化还可能受益于从所见数据中学习到的可重用视觉语义线索,包括属性、动作、状态和上下文关系。现有的实时OVD方法主要强调词汇覆盖和高效的区域/查询-文本匹配;在严格的效率限制下,紧凑型检测器可能难以吸收丰富的实例语义和场景上下文。我们提出了 RT-DETR-World,一种紧凑的 DETR 式检测器,它在训练期间传输描述传达的丰富语义,同时在推理时保留轻量级查询文本匹配。我们构建具有三个监督级别的 GroundingCapv2:标准 OVD 的类别名称、传达实例级语义的对象描述以及传达对象关系和场景上下文的图像描述。这些描述仅用作训练时语义 监督。为了帮助紧凑型检测器吸收这些语义,我们提出了双路径描述对齐(DDA),将部署一致的 MiniLM 路径与仅训练的 LLM 教师相结合。 MiniLM 提供查询类别监督和对象描述对齐,而离线教师功能分别在对象和图像级别监督匹配的查询和全局视觉表示。所有教师特征都是预先计算的,教师端模块在训练后被删除。我们进一步提出关系感知负向松弛(RNR),它使用教师衍生的语义相似性来放松相关的负向,同时保留确切的正向。实验证明了具有竞争力的零射击精度和有利的精度-效率权衡。代码将被发布。

RT-DETR-World:向实时开放词汇检测迁移LLM语义:论文原图
图 3:RT-DETR-World 概述。可部署探测器由冻结的 DINOv3 视觉编码器、轻型多尺度投影仪、DETR 解码器和紧凑型 MiniLM 组成。 DDA 将部署一致的 MiniLM 路径与仅训练的对象和图像级 LLM 监督相结合。 RNR 使用 LLM 派生的描述相似性来放宽三个描述对齐目标之间语义相关的否定。所有教师端组件在推理时都会被删除。