论文

用于文本转 3D 室内场景生成的视觉语言模型中的全局局部蒙特卡罗树搜索

Global-Local Monte Carlo Tree Search in Vision-Language Models for Text-to-3D Indoor Scene Generation

模型推理推理搜索与路径规划

摘要

大型视觉语言模型在各种任务中取得了显着的推理性能。然而,关于使用 LVLM 生成文本到 3D 室内场景的研究很少。主要挑战是流行的基于 LVLM 的方法采用思想链顺序决策机制,无法修改早期决策,从而导致错误传播。在本文中,我们将该任务视为受空间和布局常识约束的规划问题。为了解决这个问题,我们将其建模为具有全局树和局部树的树搜索问题,这与现有的顺序决策方法不同。在全局树中,我们迭代地放置每个对象并探索多种尝试,就像人类布置一个房间一样,其中问题空间被表示为一棵树。为了有效地搜索树,我们提出了分层场景表示和 PRM 引导的 MCTS 方法。该表示将场景抽象为房间级别、区域级别、地板对象级别和支持的对象级别。 PRM引导的MCTS方法使用PRM修剪不必要的分支,并使用MCTS算法平衡探索和利用,以较少的尝试获得最优解。在本地树中,它进一步将每个对象的放置分解为更精细的子步骤,包括具体的放置参数。为了使场景的整体外观保持一致,我们利用预先训练的扩散图像生成模型来预测场景中所有对象的纹理。由于文本到 3D 室内场景生成的现有基准在规模和多样性方面仍然有限,我们收集了一个新的大规模多样化数据集,其中包含 65 个场景类型和 3250 条具有不同大小、布局和风格的指令,名为 3DTindo-bench,以更好地评估最先进模型的能力。我们的实验表明,我们的方法比最先进的方法生成更真实的 3D 场景。