论文
RT-DETR-World:向实时开放词汇检测迁移LLM语义
RT-DETR-World: Transferring Rich LLM Semantics to Real-Time Open-Vocabulary Detection
摘要
开放词汇检测(OVD)通过文本类别查询来识别训练期间未见过的类别,但以实时效率实现强泛化仍然具有挑战性。除了词汇量缩放之外,零样本泛化还可能受益于从所见数据中学习到的可重用视觉语义线索,包括属性、动作、状态和上下文关系。现有的实时OVD方法主要强调词汇覆盖和高效的区域/查询-文本匹配;在严格的效率限制下,紧凑型检测器可能难以吸收丰富的实例语义和场景上下文。我们提出了 RT-DETR-World,一种紧凑的 DETR 式检测器,它在训练期间传输描述传达的丰富语义,同时在推理时保留轻量级查询文本匹配。我们构建具有三个监督级别的 GroundingCapv2:标准 OVD 的类别名称、传达实例级语义的对象描述以及传达对象关系和场景上下文的图像描述。这些描述仅用作训练时语义 监督。为了帮助紧凑型检测器吸收这些语义,我们提出了双路径描述对齐(DDA),将部署一致的 MiniLM 路径与仅训练的 LLM 教师相结合。 MiniLM 提供查询类别监督和对象描述对齐,而离线教师功能分别在对象和图像级别监督匹配的查询和全局视觉表示。所有教师特征都是预先计算的,教师端模块在训练后被删除。我们进一步提出关系感知负向松弛(RNR),它使用教师衍生的语义相似性来放松相关的负向,同时保留确切的正向。实验证明了具有竞争力的零射击精度和有利的精度-效率权衡。代码将被发布。
