论文

FineHOI:用于零样本人机交互检测的部分感知密集表示

FineHOI: Part-Aware Dense Representations for Zero-Shot Human-Object Interaction Detection

模型架构Transformer

摘要

人与物体交互(HOI)检测旨在定位图像中的人和物体并对它们的交互进行分类。零样本 HOI 专注于识别训练期间未观察到的交互,要求模型能够概括出可见的动词-宾语组合。最近的方法利用视觉语言模型(VLM),受益于丰富的语义表示。然而,它们通常依赖于全局或以检测器为中心的特征,这些特征会压缩交互线索并阻碍细粒度的空间推理。为了克服这一限制,我们提出了 FineHOI,这是一种零样本 HOI 框架,可以显式地对密集补丁级特征的交互进行建模。我们的方法的动机是观察到人与物体的交互是由局部空间关系定义的,而局部空间关系并没有被全局和以检测器为中心的表示所保留。为此,我们引入了自适应部分级注意力模块,该模块通过无监督聚类将人类和物体分解为语义连贯的部分,并根据它们的交互相关性重新加权。然后,这些表示通过区域感知交互 Transformer 进行集成,该交互集成了部分感知和全局特征,并生成最终的 HOI 嵌入。大量实验表明,FineHOI 始终优于现有的零样本 HOI 方法,在未见交互方面取得了特别强劲的收益。代码可在 https://github.com/francescotonini/fine-hoi 获取。