论文
ElasticFit:以视觉语言推理与生成适配插入 3D 对象
ElasticFit: Fit-Aware 3D Object Insertion via VLM Reasoning and Generative Adaptation
摘要
将对象插入到现有 3D 场景中需要的不仅仅是选择一个合理的位置:插入的对象还必须适合局部几何形状,同时保留语义意图和物理合理性。尽管最近的视觉语言模型 (VLM) 和生成模型支持语义推理和视觉内容创建,但当插入的对象必须适合受限的局部空间时,它们提供有限的 3D 基础和几何控制。我们引入了 ElasticFit,这是一个 VLM 引导的框架,用于以新颖的基于场景的表示为中心的适合感知对象插入。给定语言指令和渲染的场景观察,ElasticFit 会推断结构化拟合线索,指定对象应接地的位置、应占据的体积、应如何定向及其适应模式(刚性放置、均匀缩放或弹性拟合)。这些线索将高级 VLM 推理转换为显式 3D 约束,以调节对象生成并指导下游几何拟合。然后,ElasticFit 会先生成一个场景条件对象,以 3D 形式对其进行重建,并通过特定于模式的拟合来细化网格,同时强制避免碰撞、接触一致性和物理接地。在固定资产基线比较中,ElasticFit 将空间关系成功率从 50.8% 提高到 69.7%,并将支持成功率从最强基线的 48.3% 提高到 91.7%,同时为复杂场景中的生成式“make-it-fit”插入提供新颖的支持。
