论文

UnfoldArt:从文本或图像中零次恢复全铰接 3D 对象

UnfoldArt: Zero-Shot Recovery of Full Articulated 3D Objects from Text or Image

智能体系统Agent 协作

摘要

铰接式 3D 对象对于具体人工智能、机器人和虚拟现实中的交互环境至关重要,但从稀疏观察中重建其结构和运动仍然具有挑战性。现有的方法在很大程度上仍然受到缺乏监督数据或缺乏可靠地恢复关节、隐藏几何和内部对象结构所需的先验的限制。我们提出了第一个由辩论驱动的代理方法,用于根据文本或图像输入重建铰接 3D 对象,该方法既基于具体运动中的铰接推理,又暴露了铰接下揭示的遮挡几何形状。高级智能体使用视觉语言和视频模型中的知识来推理对象语义和运动,而底层智能体则估计关节参数和交互点;他们一起进行两轮结构化辩论,首先利用全局与局部的分歧,然后让智能体们以自由生成的视频为基础。之前的同一视频,以商定的清晰度为条件,然后通过其运动驱动每个部件,以暴露无法从单个静态视图推断出的被遮挡的内部和几何形状。通过将代理推理与视频生成先验相结合,我们的方法联合推断关节并重建完整的 3D 关节对象,产生超出直接观察表面的高保真几何形状、内部结构和运动一致状态。