论文
利用多模态大语言模型进行无需训练人机交互检测
Harnessing Multimodal Large Language Models for Training-Free Human-Object Interaction Detection
摘要
人与物体交互(HOI)检测旨在定位人与物体对并识别他们的交互。传统的监督方法表现强劲,但依赖于特定于任务的训练。最近的多模态大语言模型 (MLLM) 通过其广泛的视觉语义知识和多功能的感知和推理能力,为无需训练 HOI 检测提供了一条有前途的途径。然而,现有方法主要通过松散协调的推理阶段来调用这些功能。这种碎片化的执行限制了交互假设在指导视觉探索中的作用,导致关键参与者被忽视,局部模糊性也得不到解决。此外,通过随后的视觉定位和关系预测传播早期的语义假设会导致自我强化的语义循环。为了解决这些挑战,我们提出了HarnessHOI,这是一个无需训练框架,它将被动的MLLM推理转变为以主动交互为中心的Harness。具体来说,我们引入了一种交互引导的感知机制,将新兴的交互假设投射回视觉空间,以发现缺失的参与者,并通过有针对性的观察来完善模糊的证据。此外,与关系无关的几何裁决模块可以协调多源证据,为跨多个动作和语义角色的扎根交互推理建立统一的空间定位依据。 HICO-DET 和 V-COCO 上的大量实验表明,HarnessHOI 在无需训练方法中实现了最先进的性能,证实了所提出的Harness对于复杂交互理解的有效性。代码将在发布后发布。
