论文

用于生成机器人操作命令的解耦的以对象为中心的视频理解

Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands

摘要

将视频演示转换为可执行的机器人命令仍然具有挑战性,因为现有方法通常无法识别哪些对象在功能上参与了演示的动作。因此,它们可能会生成语言上合理但操作上模糊的命令。我们提出了一种以对象为中心的视频理解框架,它将动作识别与对象识别分离,以生成精确的、无语法的操作命令。我们的方法将用于高效时空动作分类的时间转换模块(TSM)与新颖的 \textbf{对象选择} 算法相集成,该算法通过基于轨迹的角色分类、模糊检测和重叠最小化来识别任务相关对象。然后,所选对象由视觉语言模型 (VLM) 进行处理,以实现稳健的类别识别和零样本泛化。在修改后的 Something-Something V2 数据集上进行评估,我们的方法在标准对象上实现了 86.79% 的动作分类准确率,BLEU-4 得分为 0.337,在新颖对象上达到了 0.261。这些结果比最强的特定任务基线分别提高了 80.2% 和 143.9%。在 METEOR 和 CIDEr 中观察到更大的增益,在新物体上达到 157.9% 和 171.7%。在所有语义指标中,我们的方法始终优于特定于任务的方法,并与大型通用 VLM 保持竞争或超越,同时保留模块化、以对象为中心的设计。