论文

HOIBlender:将轻量级检测与视觉语言先验相结合,实现高效的人机交互检测

HOIBlender: Blending Lightweight Detection with Vision-Language Priors for Efficient Human-Object Interaction Detection

应用与实践视觉感知与空间理解

摘要

人机交互 (HOI) 检测需要建立交互的人机对并识别链接它们的动词,通常是在严格的长尾监督下。最近的方法通过更强大的检测器和视觉语言先验提高了准确性,但许多方法仍然在检测器之上堆叠重型Transformer编码器、复杂的去噪计划或事后语义校准。我们提出了 \textbf{HOIBlender},这是一种高效的 HOI 检测器,以其核心设计原理命名:在一个轻量级解码管道中混合基于检测器的视觉标记、空间主客体推理和 BLIP-2 语义先验。 HOIBlender 建立在具有 DINOv2 主干的 RF-DETR/LW-DETR 式基础上,并直接从多尺度投影仪中选择顶级 $K$ 图像条件词元作为主题和对象候选者,从而删除了先前 HOI 方法保留的专用编码器阶段。双级解码器首先稳定人体几何形状,然后通过渐进式 BLIP-2 先验融合执行动词和 HOI 分类,分类器权重从长尾类别的 BLIP-2 文本嵌入初始化。分组查询训练进一步丰富了优化,而不会增加推理成本。在三种模型规模(Nano、Small、2XL)中,HOIBlender 在 HICO-DET 上始终优于 SOV-STG-VLA 和 Hybrid-SOV-VLA,仅在 9 美元的训练周期内就达到 44.49 美元的默认完整 mAP,同时保持有竞争力的延迟和参数预算。这些结果表明,轻量级检测、结构化空间语义解码和深度集成的视觉语言先验可以混合到单个高效的 HOI 管道中。