论文
Object-Uni:以对象为中心的空间理解和可控生成的统一模型
Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation
摘要
视觉理解和生成的统一模型已经取得了快速进展,但它们仍然缺乏理解和操纵对象实例的空间状态的能力。现有模型可以用自然语言描述物体,但它们很难精确地表示连续的物体姿势并在目标视点下生成几何一致的图像。为了缓解这个问题,我们提出了 \emph{Object-Uni},一个用于以对象为中心的空间理解和可控生成的统一模型。具体来说,我们将以对象为中心的空间智能表述为一个连接姿势感知、空间推理、姿势条件生成和以对象为中心的新颖视图合成的统一问题。我们将物体姿态视为理解和生成共享的显式几何变量,而不仅仅是预测标签或控制信号。为了使多模态 大语言模型 可以使用姿势,我们提出了一种基于视点的方向抽象,将方向映射到结构化视点描述中,同时保留连续的几何监督。我们进一步构建了一个以对象为中心的空间基准(UniSpatial-80K),并使用基于对象标记的姿势锚定来训练统一模型,以将每个实例与其姿势状态相关联。实验表明,我们的模型改进了对象级姿态理解和姿态可控生成,将统一模型从描述对象转向操纵空间状态。