论文

ElasticFit:以视觉语言推理与生成适配插入 3D 对象

ElasticFit: Fit-Aware 3D Object Insertion via VLM Reasoning and Generative Adaptation

应用与实践视觉感知与空间理解

摘要

将对象插入到现有 3D 场景中需要的不仅仅是选择一个合理的位置:插入的对象还必须适合局部几何形状,同时保留语义意图和物理合理性。尽管最近的视觉语言模型 (VLM) 和生成模型支持语义推理和视觉内容创建,但当插入的对象必须适合受限的局部空间时,它们提供有限的 3D 基础和几何控制。我们引入了 ElasticFit,这是一个 VLM 引导的框架,用于以新颖的基于场景的表示为中心的适合感知对象插入。给定语言指令和渲染的场景观察,ElasticFit 会推断结构化拟合线索,指定对象应接地的位置、应占据的体积、应如何定向及其适应模式(刚性放置、均匀缩放或弹性拟合)。这些线索将高级 VLM 推理转换为显式 3D 约束,以调节对象生成并指导下游几何拟合。然后,ElasticFit 会先生成一个场景条件对象,以 3D 形式对其进行重建,并通过特定于模式的拟合来细化网格,同时强制避免碰撞、接触一致性和物理接地。在固定资产基线比较中,ElasticFit 将空间关系成功率从 50.8% 提高到 69.7%,并将支持成功率从最强基线的 48.3% 提高到 91.7%,同时为复杂场景中的生成式“make-it-fit”插入提供新颖的支持。

ElasticFit:以视觉语言推理与生成适配插入 3D 对象:论文原图
图 2:ElasticFit 概述。给定用户指令 $L$ 和现有 3D 场景 $S$,ElasticFit 推断出编码目标区域、方向、约束和适应行为的结构化拟合线索 $G$。第 1 阶段执行语义空间基础,第 2 阶段在 $O_{0}$ 之前生成场景条件对象。第 3 阶段通过具有刚性、均匀或弹性适应的几何和物理感知拟合对其进行细化。结果是稳定的最终插入 $O^{\ast}$。