论文
以自我为中心的视频语言模型能否捕捉到以手和物体为中心的线索?
Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?
摘要
手-物体交互(HOI)识别需要捕获手部操作和物体变换。然而,现有的视频语言模型往往依赖于手、物体或环境上下文之间的虚假相关性,而不是根据手和物体本身的外观和动态进行推理,从而走捷径。为了解决这个限制,我们提出了一种新的学习范式,它结合了(i)手部物体掩蔽训练,可以从部分手部或物体观察中进行稳健推理,以及(ii)HOI动态感知解码器,可以通过位置和语义的辅助预测来明确学习以手部和物体为中心的嵌入,从而增强对这两种线索的敏感性。为了系统地评估这种特定线索的推理,我们引入了线索隔离 HOI (CI-HOI),这是一种新的评估方法,可评估模型根据手部和物体相关线索独立预测动作的能力。为了实现 CI-HOI,我们策划了 DEHOI 测试平台,该测试平台将与手和物体相关的观察结果分开,以便通过修复来解开 HOI 评估。使用 DEHOI,我们定量和定性地证明,我们的训练策略比现有模型更有效地利用以手和物体为中心的信息。我们的方法改进了 DEHOI、标准动作识别、物体状态识别,甚至机器人操纵动作识别的现有模型,从而实现更强大的 HOI 理解。