论文

Blender 中的思考:使用视觉语言模型分阶段执行逆向图形

Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models

模型推理推理策略与问题分解

摘要

逆向图形是一个长期存在且高度受限的问题,旨在将图像重建为可编辑的 3D 场景,以便进行渲染、重新点亮和操作。在这项工作中,我们研究预训练的视觉语言模型 (VLM) 是否可以通过将场景重建为可编辑的 Blender 程序,直接从单个图像执行可执行的逆向图形,而不依赖于专门的 2D 或 3D 基础模型、可微分渲染或多视图监督。我们引入了阶段可执行逆向图形 (SEIG),这是一种代理框架,通过直接在可执行 Blender 代码空间中逐步细化场景因素(包括几何、材质、合成和照明),从单个图像重建 3D 场景。我们使用一系列跨越像素级、感知和语义保真度的重建指标来评估我们在不同场景中的框架。我们的实验表明,分阶段重建大大提高了重建保真度,凸显了使用通用 VLM 进行可执行逆向图形任务分解的重要性。最后,我们展示了由重建的可编辑 Blender 场景支持的各种下游应用程序。