论文

通过闭环 VLM 代理进行文本引导的 6D 对象姿势重新排列

Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents

智能体系统Agent 环境交互

摘要

视觉语言模型 (VLM) 表现出强大的视觉推理能力,但在 3D 理解方面仍然存在困难。特别是,VLM 通常无法推断 3D 场景中目标对象的文本一致的目标 6D 姿态。然而,我们发现通过一些推理时间技术和迭代推理,VLM 可以实现显着的性能提升。具体来说,给定由 RGB-D 图像(或 3D 网格的合成场景)表示的 3D 场景和指定所需状态变化的文本指令,我们重复以下循环:观察当前场景;评估是否忠实于指令;提出目标对象的姿态更新;应用更新;并渲染更新的场景。通过这种闭环交互,VLM 有效地充当代理。我们进一步介绍了对于这个闭环过程至关重要的三种推理时间技术:(i)支持视图选择的多视图推理,(ii)以对象为中心的坐标系可视化,以及(iii)单轴旋转预测。无需任何额外的 微调 或新模块,我们的方法在预测目标对象的文本引导目标 6D 姿态方面超越了先前的方法。它在闭源和开源 VLM 中都能一致地工作。此外,当将我们的 6D 位姿预测与简单的机器人运动规划相结合时,它比最近的视觉-语言-动作模型 (VLA) 能够实现更成功的机器人操作。最后,我们进行了消融研究,以证明每种提出的技术的必要性。