论文
释放多模态 大语言模型 用于 无需训练 HOI 野外检测
Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild
摘要
人与物体交互检测(HOID)传统上被表述为预定义交互类别的监督检测问题。虽然此类范例在封闭集基准上取得了出色的性能,但它们从根本上将交互理解与特定于数据集的监督纠缠在一起,限制了它们推广到开放世界和组合场景的能力。最近的 HOI 检测器尝试通过提示策略来利用 MLLM 来传递特定于交互的知识。然而,这种基于提示的方法主要侧重于从预训练模型中提取判别性表示,而没有充分探索其固有的多模态推理能力。因此,他们很难为模糊和开放世界的交互场景提供信息丰富的上下文推理。在这项工作中,我们提出了 AgentHOI,一个 无需训练 代理框架,它将基础模型的通用多模态推理能力转移到实际的 HOI 检测中。 AgentHOI 不是学习交互分类器,而是模块化地编排互补的视觉基础模块,以协调的方式执行开放式语义推理和空间基础。为了解决复杂场景中不完整的交互发现和模糊定位的挑战,我们引入了两种关键机制:(1)上下文感知多轮推理,逐步细化交互假设,以确保详尽和组合的 HOI 发现;(2)多方面交互定位,通过生成集成语义、空间和外观线索的特定于实例的描述来提高基础精度。大量实验表明,尽管不需要 HOID 数据进行训练,但在现实环境中,AgentHOI 的性能优于最先进的监督和弱监督方法。