论文

迈向无约束的人机交互

Towards Unconstrained Human-Object Interaction

应用与实践视觉感知与空间理解

摘要

人与物体交互(HOI)检测是一个长期存在的计算机视觉问题,涉及预测人与物体之间的交互。当前的 HOI 模型依赖于训练和推理时的交互词汇,限制了它们对静态环境的适用性。随着多模态 大语言模型 (MLLM) 的出现,探索更灵活的交互识别范例变得可行。在这项工作中,我们通过 MLLM 镜头重新审视 HOI 检测,并将其应用于野外 HOI 检测。我们定义了无约束 HOI (U-HOI) 任务,这是一个新颖的 HOI 域,它消除了训练和推理时预定义交互列表的要求。我们在此设置上评估了一系列 MLLM,并引入了一个管道,其中包括测试时推理和语言到图形的转换,以从自由格式文本中提取结构化交互。我们的研究结果强调了当前 HOI 探测器的局限性以及 MLLM 对 U-HOI 的价值。代码可在 https://github.com/francescotonini/anyhoi 获取